Tesseract
Quelloffene OCR-Engine, die Text aus gescannten Dokumenten und Bildern extrahiert und dabei mehr als 100 Sprachen von Haus aus unterstützt.
Überblick
Tesseract ist eine quelloffene Optical-Character-Recognition(OCR)-Engine, ursprünglich bei HP entwickelt und heute von Google zusammen mit einer Community von Contributors gepflegt. Sie wird als Kommandozeilenprogramm und als Bibliothek libtesseract ausgeliefert und unterstützt sowohl eine neuere, auf LSTM-Neuronalen-Netzen basierende Erkennungs-Engine (Standard seit Tesseract 4) als auch die alte, musterbasierte Engine aus Tesseract 3 für Kompatibilität.
Sie liest gängige Bildformate wie PNG, JPEG und TIFF, erkennt dank Unicode/UTF-8-Unterstützung Text in mehr als 100 Sprachen von Haus aus und kann Klartext, durchsuchbares PDF, hOCR, TSV und weitere strukturierte Formate ausgeben – wobei wie bei jeder OCR-Engine die Ergebnisqualität stark von der Qualität des Eingabebilds abhängt.
Tesseract eignet sich für Teams, die Text aus gescannten Dokumenten, fotografierten Formularen oder Bildern als Teil einer Datenpipeline extrahieren müssen – etwa zur Digitalisierung von Papierdokumenten, zur Indexierung gescannter Archive oder um Text in eine LLM-/RAG-Pipeline einzuspeisen –, als Ergänzung zu PDF.js (ebenfalls in diesem Katalog), das PDFs rendert und parst, die bereits eine Textebene enthalten, statt Text aus Pixeln zu erkennen.
- Kategorien
- Medien
- Sprachen
- C++
- Lizenz
- Apache-2.0
Ähnliche Projekte
FFmpeg
LGPL-2.1Das Branchenstandard-Toolkit zum Aufnehmen, Konvertieren und Streamen von Audio und Video in praktisch jedem Format.
- Medien
imgproxy
Apache-2.0Schneller, eigenständiger Server zum Skalieren, Verarbeiten und Konvertieren von Bildern in Echtzeit, als direkter Ersatz für Bildverarbeitungscode in der eigenen Anwendung.
- Medien
Jellyfin
GPL-2.0Freie Mediensystem-Software, mit der du die volle Kontrolle über die Verwaltung und das Streaming deiner Medien hast.
- Medien
PDF.js
Apache-2.0Allzweck-Plattform auf Basis von Webstandards zum Parsen und Rendern von PDFs im Browser.
- Medien
Einen Fehler entdeckt? Änderung auf GitHub vorschlagen.