Docling
Biblioteca de análisis de documentos que convierte PDFs, documentos de Word y otros formatos en datos limpios y estructurados listos para pipelines de LLM y RAG.
Descripción general
Docling analiza formatos de documento complejos —PDFs con tablas y figuras, documentos de Word, archivos de PowerPoint y más— y los convierte en representaciones estructuradas (como Markdown o JSON) que conservan la información de maquetación que un LLM puede realmente usar, en lugar del texto plano y confuso que produce una conversión ingenua de PDF a texto. Está construido pensando específicamente en pipelines de RAG e ingesta de LLM.
Docling encaja en equipos que alimentan documentos a un LLM o pipeline de RAG y necesitan una conservación precisa de la estructura, complementando a Tesseract (también en este catálogo): Tesseract reconoce texto a partir de píxeles en bruto, mientras que Docling se centra en comprender la estructura y maquetación de un documento.
- Categorías
- IA y Machine Learning
- Palabras clave
- document-parsingragpdf-processingdata-extraction
- Lenguajes
- Python
- Licencia
- MIT
Proyectos relacionados
Haystack
Apache-2.0Framework de código abierto para construir aplicaciones de búsqueda y RAG (generación aumentada por recuperación) listas para producción con LLMs.
- IA y Machine Learning
Instructor
MITBiblioteca para obtener salidas de datos estructurados y fiables de LLMs usando APIs de function calling y modelos Pydantic para la validación.
- IA y Machine Learning
LangChain
MITFramework para desarrollar aplicaciones impulsadas por modelos de lenguaje grandes, agentes y generación aumentada por recuperación (RAG).
- IA y Machine Learning
LlamaIndex
MITFramework de datos para conectar grandes modelos de lenguaje con tus propios datos —documentos, bases de datos, APIs— para aplicaciones de generación aumentada por recuperación.
- IA y Machine Learning
¿Encontraste un error? Sugiere una edición en GitHub.