Docling
PDF、Word ドキュメントなどのフォーマットを、LLM や RAG パイプライン向けにきれいで構造化されたデータへ変換する、ドキュメント解析ライブラリです。
概要
Docling は、表や図を含む PDF、Word 文書、PowerPoint ファイルなど、複雑なドキュメントフォーマットを、単純な PDF からテキストへの変換で生じる文字化けしたプレーンテキストではなく、LLM が実際に活用できるレイアウト情報を保持した構造化された表現(Markdown や JSON など)に解析します。RAG や LLM の取り込みパイプラインを特に念頭に置いて構築されています。
Docling は、正確な構造の保持を必要とする、LLM や RAG パイプラインにドキュメントを取り込むチームに向いています。(カタログにもある) Tesseract を補完する存在で、Tesseract が生のピクセルからテキストを認識するのに対し、Docling はドキュメントの構造とレイアウトを理解することに重点を置いています。
- カテゴリ
- AI・機械学習
- 言語
- Python
- ライセンス
- MIT
関連プロジェクト
Haystack
Apache-2.0LLM を使った本番運用向けの検索・RAG(検索拡張生成)アプリケーションを構築するための、オープンソースフレームワークです。
- AI・機械学習
Instructor
MIT検証のための function calling API と Pydantic モデルを使って、LLM から信頼できる構造化データ出力を得るためのライブラリです。
- AI・機械学習
LangChain
MIT大規模言語モデル、エージェント、検索拡張生成(RAG)を活用したアプリケーションを開発するためのフレームワークです。
- AI・機械学習
LlamaIndex
MIT検索拡張アプリケーションのために、大規模言語モデルを自分自身のデータ——ドキュメント、データベース、API——に接続するためのデータフレームワークです。
- AI・機械学習
誤りを見つけましたか? GitHub で修正を提案する