Tesseract
스캔한 문서와 이미지에서 텍스트를 추출하는 오픈소스 OCR 엔진으로, 100개 이상의 언어를 기본으로 지원합니다.
개요
Tesseract는 원래 HP에서 개발되었고 지금은 Google과 커뮤니티 컨트리뷰터들이 함께 유지 관리하는 오픈소스 광학 문자 인식(OCR) 엔진입니다. 커맨드라인 프로그램과 라이브러리(libtesseract) 형태로 모두 제공되며, 더 새로운 LSTM 신경망 기반 인식 엔진(Tesseract 4부터 기본값)과, 호환성을 위해 남아 있는 Tesseract 3의 패턴 매칭 기반 레거시 엔진을 모두 지원합니다.
PNG, JPEG, TIFF 같은 일반적인 이미지 형식을 읽을 수 있고, 유니코드/UTF-8 지원 덕분에 100개 이상의 언어 텍스트를 기본으로 인식할 수 있으며, 일반 텍스트, 검색 가능한 PDF, hOCR, TSV 등 다양한 구조화 형식으로 출력할 수 있습니다. 다만 다른 OCR 엔진과 마찬가지로 인식 결과의 품질은 입력 이미지의 품질에 크게 좌우됩니다.
Tesseract는 스캔한 문서, 촬영한 양식, 이미지에서 텍스트를 추출해 데이터 파이프라인에 포함시켜야 하는 팀에 적합합니다. 종이 문서 디지털화, 스캔 자료 색인화, LLM·RAG 파이프라인에 텍스트를 공급하는 용도 등이 그 예입니다. (카탈로그에 있는) PDF.js를 보완하는 관계로, PDF.js는 이미 텍스트 레이어를 포함한 PDF를 렌더링·파싱하는 도구이지 픽셀에서 텍스트를 인식하는 도구가 아닙니다.
- 카테고리
- 미디어
- 언어
- C++
- 라이선스
- Apache-2.0
관련 프로젝트
잘못된 정보를 발견하셨나요? GitHub에서 수정 제안하기