跳至内容
FindOpenSource

Docling

文档解析库,将 PDF、Word 文档等格式转换为适用于 LLM 和 RAG 流水线的干净结构化数据。

概述

Docling 能解析复杂的文档格式——带表格和图片的 PDF、Word 文档、PowerPoint 文件等——转换为保留版式信息、可供大语言模型实际使用的结构化表示(如 Markdown 或 JSON),而不是简单的 PDF 转文本所产生的杂乱纯文本。它是专门为 RAG 和大语言模型数据摄取流水线而构建的。

Docling 适合那些需要将文档输入大语言模型或 RAG 流水线、并要求精确保留结构的团队,与目录中的 Tesseract 形成互补——Tesseract 从原始像素中识别文字,而 Docling 专注于理解文档的结构和版式。

分类
AI 与机器学习
关键词
document-parsingragpdf-processingdata-extraction
编程语言
Python
许可证
MIT

发现信息有误?在 GitHub 上提出修改建议