DeepEval
开源测试框架,用于评估大语言模型输出,将大语言模型应用的质量检查视为传统单元测试。
概述
DeepEval 专门为大语言模型输出提供指标和测试原语——答案相关性、对源文档的忠实度、幻觉检测等——使团队能够像编写常规代码的单元测试一样,为大语言模型应用的质量编写自动化测试,并在 CI 中运行。它与 Pytest 等常见测试框架集成。
DeepEval 适合那些希望对大语言模型或 RAG 应用输出进行系统化、自动化质量检查、而不是人工抽查的团队,与目录中的 Promptfoo 形成互补——两者都致力于大语言模型评估,DeepEval 更偏向基于 pytest 原生的单元测试工作流。
- 分类
- AI 与机器学习
- 编程语言
- Python
- 许可证
- Apache-2.0
广告
相关项目
发现信息有误?在 GitHub 上提出修改建议。