コンテンツへスキップ
FindOpenSource

DeepEval

LLM の出力を評価するためのオープンソーステストフレームワークで、LLM アプリケーションの品質チェックを従来のユニットテストのように扱います。

概要

DeepEval は、回答の関連性、ソースドキュメントへの忠実性、ハルシネーション検知など、LLM の出力専用のメトリクスとテストプリミティブを提供します。これにより、チームは通常のコードのユニットテストを書くのと同じように LLM アプリケーションの品質に対する自動テストを書き、CI で実行できます。Pytest のような一般的なテストフレームワークと統合できます。

DeepEval は、手動での抜き取り確認ではなく、LLM や RAG アプリケーションの出力に対する体系的で自動化された品質チェックを求めるチームに向いています。(カタログにもある) Promptfoo を補完する存在で、両者とも LLM の評価を扱いますが、DeepEval は pytest ネイティブなユニットテストのワークフローに寄っています。

カテゴリ
AI・機械学習
キーワード
llm-evaluationtestingrag-evaluation
言語
Python
ライセンス
Apache-2.0

誤りを見つけましたか? GitHub で修正を提案する