본문으로 건너뛰기
FindOpenSource

DeepEval

LLM 출력을 평가하는 오픈소스 테스트 프레임워크로, LLM 애플리케이션의 품질 검사를 전통적인 단위 테스트처럼 다룹니다.

개요

DeepEval은 답변 관련성, 원본 문서에 대한 충실성, 환각 탐지 등 LLM 출력에 특화된 지표와 테스트 프리미티브를 제공하여, 팀이 일반 코드의 단위 테스트를 작성하듯 LLM 애플리케이션 품질에 대한 자동화된 테스트를 작성하고 CI에서 실행할 수 있게 해줍니다. Pytest 같은 일반적인 테스트 프레임워크와 통합됩니다.

DeepEval은 수동 샘플 점검 대신 LLM이나 RAG 애플리케이션 출력에 대한 체계적이고 자동화된 품질 검사를 원하는 팀에 적합하며, (카탈로그에 있는) Promptfoo를 보완합니다 — 둘 다 LLM 평가를 다루지만, DeepEval은 pytest 네이티브 단위 테스트 워크플로에 더 가깝습니다.

카테고리
AI 및 머신러닝
키워드
llm-evaluationtestingrag-evaluation
언어
Python
라이선스
Apache-2.0

잘못된 정보를 발견하셨나요? GitHub에서 수정 제안하기