Saltar al contenido
FindOpenSource

Docling

Biblioteca de análisis de documentos que convierte PDFs, documentos de Word y otros formatos en datos limpios y estructurados listos para pipelines de LLM y RAG.

Descripción general

Docling analiza formatos de documento complejos —PDFs con tablas y figuras, documentos de Word, archivos de PowerPoint y más— y los convierte en representaciones estructuradas (como Markdown o JSON) que conservan la información de maquetación que un LLM puede realmente usar, en lugar del texto plano y confuso que produce una conversión ingenua de PDF a texto. Está construido pensando específicamente en pipelines de RAG e ingesta de LLM.

Docling encaja en equipos que alimentan documentos a un LLM o pipeline de RAG y necesitan una conservación precisa de la estructura, complementando a Tesseract (también en este catálogo): Tesseract reconoce texto a partir de píxeles en bruto, mientras que Docling se centra en comprender la estructura y maquetación de un documento.

Categorías
IA y Machine Learning
Palabras clave
document-parsingragpdf-processingdata-extraction
Lenguajes
Python
Licencia
MIT

¿Encontraste un error? Sugiere una edición en GitHub.