跳至内容
FindOpenSource

Tesseract

开源 OCR 引擎,可从扫描文档和图片中提取文字,开箱即支持 100 多种语言。

概述

Tesseract 是一个开源的光学字符识别(OCR)引擎,最初由 HP 开发,如今由 Google 与社区贡献者共同维护。它以命令行程序和库(libtesseract)两种形式发布,既支持较新的、基于 LSTM 神经网络的识别引擎(自 Tesseract 4 起为默认引擎),也为兼容性保留了 Tesseract 3 中基于模式匹配的旧引擎。

它支持 PNG、JPEG、TIFF 等常见图片格式,凭借对 Unicode/UTF-8 的支持,开箱即可识别 100 多种语言的文字,并能输出纯文本、可搜索 PDF、hOCR、TSV 等多种结构化格式——不过与任何 OCR 引擎一样,识别结果的质量在很大程度上取决于输入图片的质量。

Tesseract 适合那些需要从扫描文档、拍摄的表单或图片中提取文字、并将其纳入数据管道的团队——例如纸质文档数字化、为扫描档案建立索引,或将文字输入 LLM/RAG 管道;它与目录中的 PDF.js 形成互补:PDF.js 渲染和解析的是已经包含文本层的 PDF,而不是从像素中识别文字。

分类
媒体
关键词
ocrtext-extractiondocument-processingimage-to-text
编程语言
C++
许可证
Apache-2.0

发现信息有误?在 GitHub 上提出修改建议