Zum Inhalt springen
FindOpenSource

Tesseract

Quelloffene OCR-Engine, die Text aus gescannten Dokumenten und Bildern extrahiert und dabei mehr als 100 Sprachen von Haus aus unterstützt.

Überblick

Tesseract ist eine quelloffene Optical-Character-Recognition(OCR)-Engine, ursprünglich bei HP entwickelt und heute von Google zusammen mit einer Community von Contributors gepflegt. Sie wird als Kommandozeilenprogramm und als Bibliothek libtesseract ausgeliefert und unterstützt sowohl eine neuere, auf LSTM-Neuronalen-Netzen basierende Erkennungs-Engine (Standard seit Tesseract 4) als auch die alte, musterbasierte Engine aus Tesseract 3 für Kompatibilität.

Sie liest gängige Bildformate wie PNG, JPEG und TIFF, erkennt dank Unicode/UTF-8-Unterstützung Text in mehr als 100 Sprachen von Haus aus und kann Klartext, durchsuchbares PDF, hOCR, TSV und weitere strukturierte Formate ausgeben – wobei wie bei jeder OCR-Engine die Ergebnisqualität stark von der Qualität des Eingabebilds abhängt.

Tesseract eignet sich für Teams, die Text aus gescannten Dokumenten, fotografierten Formularen oder Bildern als Teil einer Datenpipeline extrahieren müssen – etwa zur Digitalisierung von Papierdokumenten, zur Indexierung gescannter Archive oder um Text in eine LLM-/RAG-Pipeline einzuspeisen –, als Ergänzung zu PDF.js (ebenfalls in diesem Katalog), das PDFs rendert und parst, die bereits eine Textebene enthalten, statt Text aus Pixeln zu erkennen.

Kategorien
Medien
Schlagwörter
ocrtext-extractiondocument-processingimage-to-text
Sprachen
C++
Lizenz
Apache-2.0

Einen Fehler entdeckt? Änderung auf GitHub vorschlagen.