DeepEval
LLM 출력을 평가하는 오픈소스 테스트 프레임워크로, LLM 애플리케이션의 품질 검사를 전통적인 단위 테스트처럼 다룹니다.
개요
DeepEval은 답변 관련성, 원본 문서에 대한 충실성, 환각 탐지 등 LLM 출력에 특화된 지표와 테스트 프리미티브를 제공하여, 팀이 일반 코드의 단위 테스트를 작성하듯 LLM 애플리케이션 품질에 대한 자동화된 테스트를 작성하고 CI에서 실행할 수 있게 해줍니다. Pytest 같은 일반적인 테스트 프레임워크와 통합됩니다.
DeepEval은 수동 샘플 점검 대신 LLM이나 RAG 애플리케이션 출력에 대한 체계적이고 자동화된 품질 검사를 원하는 팀에 적합하며, (카탈로그에 있는) Promptfoo를 보완합니다 — 둘 다 LLM 평가를 다루지만, DeepEval은 pytest 네이티브 단위 테스트 워크플로에 더 가깝습니다.
- 카테고리
- AI 및 머신러닝
- 언어
- Python
- 라이선스
- Apache-2.0
광고
관련 프로젝트
Promptfoo
MITLLM 프롬프트를 테스트하고 평가하는 오픈소스 도구로, 모델 간 출력을 비교하고 배포 전에 품질 저하를 잡아냅니다.
- AI 및 머신러닝
CAMEL
Apache-2.0자율적으로 협업하는, 여러 개의 소통하는 역할극 AI 에이전트 시스템을 연구하고 구축하기 위한 오픈소스 프레임워크입니다.
- AI 및 머신러닝
CrewAI
MIT역할 기반으로 협업하는 AI 에이전트 팀을 구축해 복잡한 작업을 자율적으로 함께 완수하게 하는 멀티 에이전트 오케스트레이션 프레임워크입니다.
- AI 및 머신러닝
DeepSpeed
Apache-2.0매우 큰 모델을 여러 GPU에 걸쳐 효율적으로 학습하고 실행하기 위한 Microsoft의 딥러닝 최적화 라이브러리입니다.
- AI 및 머신러닝
잘못된 정보를 발견하셨나요? GitHub에서 수정 제안하기