Zum Inhalt springen
FindOpenSource

Docling

Dokumentenparsing-Bibliothek, die PDFs, Word-Dokumente und andere Formate in saubere, strukturierte Daten für LLM- und RAG-Pipelines umwandelt.

Überblick

Docling parst komplexe Dokumentformate – PDFs mit Tabellen und Abbildungen, Word-Dokumente, PowerPoint-Dateien und mehr – in strukturierte Darstellungen (wie Markdown oder JSON), die Layout-Informationen bewahren, die ein LLM tatsächlich nutzen kann, statt des verstümmelten Klartexts, den eine naive PDF-zu-Text-Konvertierung erzeugt. Es ist speziell mit Blick auf RAG- und LLM-Ingestion-Pipelines gebaut.

Docling eignet sich für Teams, die Dokumente in eine LLM- oder RAG-Pipeline einspeisen und eine genaue Strukturerhaltung benötigen – als Ergänzung zu Tesseract (ebenfalls in diesem Katalog): Tesseract erkennt Text aus rohen Pixeln, während sich Docling auf das Verstehen der Struktur und des Layouts eines Dokuments konzentriert.

Kategorien
KI & Machine Learning
Schlagwörter
document-parsingragpdf-processingdata-extraction
Sprachen
Python
Lizenz
MIT

Einen Fehler entdeckt? Änderung auf GitHub vorschlagen.