找到 2 个与"llm-evaluation"相关的项目
开源工具,用于测试和评估大语言模型提示词,跨模型对比输出并在部署前发现质量回退。
开源测试框架,用于评估大语言模型输出,将大语言模型应用的质量检查视为传统单元测试。