コンテンツへスキップ
FindOpenSource

Docling

PDF、Word ドキュメントなどのフォーマットを、LLM や RAG パイプライン向けにきれいで構造化されたデータへ変換する、ドキュメント解析ライブラリです。

概要

Docling は、表や図を含む PDF、Word 文書、PowerPoint ファイルなど、複雑なドキュメントフォーマットを、単純な PDF からテキストへの変換で生じる文字化けしたプレーンテキストではなく、LLM が実際に活用できるレイアウト情報を保持した構造化された表現(Markdown や JSON など)に解析します。RAG や LLM の取り込みパイプラインを特に念頭に置いて構築されています。

Docling は、正確な構造の保持を必要とする、LLM や RAG パイプラインにドキュメントを取り込むチームに向いています。(カタログにもある) Tesseract を補完する存在で、Tesseract が生のピクセルからテキストを認識するのに対し、Docling はドキュメントの構造とレイアウトを理解することに重点を置いています。

カテゴリ
AI・機械学習
キーワード
document-parsingragpdf-processingdata-extraction
言語
Python
ライセンス
MIT

誤りを見つけましたか? GitHub で修正を提案する