Promptfoo
LLM 프롬프트를 테스트하고 평가하는 오픈소스 도구로, 모델 간 출력을 비교하고 배포 전에 품질 저하를 잡아냅니다.
개요
Promptfoo는 하나 이상의 LLM 프롬프트나 모델에 대해 일련의 테스트 케이스를 실행하여, 정의된 기준에 따라 출력을 채점하고 나란히 비교해서 보여줍니다 — 그래서 팀은 출시 전에 품질을 떨어뜨리는 프롬프트 변경을 잡아내거나 같은 작업에서 서로 다른 모델의 성능을 비교할 수 있습니다. 기존 CI 파이프라인에 들어맞는 CLI로 동작합니다.
Promptfoo는 프롬프트를 반복 개선하거나 LLM 제공자를 비교하면서 수동 육안 확인 대신 데이터 기반 평가를 원하는 팀에 적합하며, (카탈로그에 있는) DeepEval을 보완합니다 — 둘 다 LLM 평가를 다루지만, Promptfoo는 특히 프롬프트와 모델 비교 쪽에 더 가깝습니다.
- 카테고리
- AI 및 머신러닝
- 언어
- TypeScript
- 라이선스
- MIT
광고
관련 프로젝트
DeepEval
Apache-2.0LLM 출력을 평가하는 오픈소스 테스트 프레임워크로, LLM 애플리케이션의 품질 검사를 전통적인 단위 테스트처럼 다룹니다.
- AI 및 머신러닝
CAMEL
Apache-2.0자율적으로 협업하는, 여러 개의 소통하는 역할극 AI 에이전트 시스템을 연구하고 구축하기 위한 오픈소스 프레임워크입니다.
- AI 및 머신러닝
CrewAI
MIT역할 기반으로 협업하는 AI 에이전트 팀을 구축해 복잡한 작업을 자율적으로 함께 완수하게 하는 멀티 에이전트 오케스트레이션 프레임워크입니다.
- AI 및 머신러닝
DeepSpeed
Apache-2.0매우 큰 모델을 여러 GPU에 걸쳐 효율적으로 학습하고 실행하기 위한 Microsoft의 딥러닝 최적화 라이브러리입니다.
- AI 및 머신러닝
잘못된 정보를 발견하셨나요? GitHub에서 수정 제안하기