Docling
PDF, Word 문서 등의 형식을 LLM과 RAG 파이프라인에 바로 사용할 수 있는 깔끔하고 구조화된 데이터로 변환하는 문서 파싱 라이브러리입니다.
개요
Docling은 표와 그림이 있는 PDF, Word 문서, PowerPoint 파일 등 복잡한 문서 형식을, 단순한 PDF-텍스트 변환이 만들어내는 깨진 일반 텍스트가 아니라 LLM이 실제로 활용할 수 있는 레이아웃 정보를 보존한 구조화된 표현(Markdown이나 JSON 등)으로 파싱합니다. RAG와 LLM 수집 파이프라인을 염두에 두고 특별히 만들어졌습니다.
Docling은 정확한 구조 보존이 필요한, 문서를 LLM이나 RAG 파이프라인에 공급하는 팀에 적합하며, (카탈로그에 있는) Tesseract를 보완합니다 — Tesseract는 원시 픽셀에서 텍스트를 인식하는 반면, Docling은 문서의 구조와 레이아웃을 이해하는 데 초점을 맞춥니다.
- 카테고리
- AI 및 머신러닝
- 언어
- Python
- 라이선스
- MIT
관련 프로젝트
Haystack
Apache-2.0LLM을 사용해 프로덕션 준비가 된 검색과 RAG(검색 증강 생성) 애플리케이션을 구축하기 위한 오픈소스 프레임워크입니다.
- AI 및 머신러닝
Instructor
MIT검증을 위한 함수 호출 API와 Pydantic 모델을 사용해 LLM으로부터 신뢰할 수 있는 구조화된 데이터 출력을 얻는 라이브러리입니다.
- AI 및 머신러닝
LangChain
MIT대규모 언어 모델, 에이전트, 검색 증강 생성(RAG)으로 구동되는 애플리케이션을 개발하기 위한 프레임워크입니다.
- AI 및 머신러닝
LlamaIndex
MIT대규모 언어 모델을 문서, 데이터베이스, API 같은 자신의 데이터에 연결해 검색 증강 애플리케이션을 만드는 데이터 프레임워크입니다.
- AI 및 머신러닝
잘못된 정보를 발견하셨나요? GitHub에서 수정 제안하기