Saltar al contenido
FindOpenSource

Tesseract

Motor OCR de código abierto que extrae texto de documentos escaneados e imágenes, con soporte de más de 100 idiomas de serie.

Descripción general

Tesseract es un motor de reconocimiento óptico de caracteres (OCR) de código abierto, desarrollado originalmente en HP y mantenido ahora por Google junto con una comunidad de colaboradores. Se distribuye como un programa de línea de comandos y una biblioteca, libtesseract, y admite tanto un motor de reconocimiento más nuevo basado en redes neuronales LSTM (el predeterminado desde Tesseract 4) como el motor heredado basado en coincidencia de patrones de Tesseract 3 por compatibilidad.

Lee formatos de imagen comunes como PNG, JPEG y TIFF, reconoce texto en más de 100 idiomas de serie gracias al soporte de Unicode/UTF-8, y puede generar texto plano, PDF con capacidad de búsqueda, hOCR, TSV y otros formatos estructurados; aunque, como con cualquier motor OCR, la calidad del resultado depende en gran medida de la calidad de la imagen de entrada.

Tesseract encaja en equipos que necesitan extraer texto de documentos escaneados, formularios fotografiados o imágenes como parte de un pipeline de datos —digitalizar papeleo, indexar archivos escaneados o alimentar texto a un pipeline de LLM/RAG—, complementando a PDF.js (también en este catálogo), que renderiza y analiza PDFs que ya contienen una capa de texto, en lugar de reconocer texto a partir de píxeles.

Categorías
Medios
Palabras clave
ocrtext-extractiondocument-processingimage-to-text
Lenguajes
C++
Licencia
Apache-2.0

¿Encontraste un error? Sugiere una edición en GitHub.