DeepEval
LLM の出力を評価するためのオープンソーステストフレームワークで、LLM アプリケーションの品質チェックを従来のユニットテストのように扱います。
概要
DeepEval は、回答の関連性、ソースドキュメントへの忠実性、ハルシネーション検知など、LLM の出力専用のメトリクスとテストプリミティブを提供します。これにより、チームは通常のコードのユニットテストを書くのと同じように LLM アプリケーションの品質に対する自動テストを書き、CI で実行できます。Pytest のような一般的なテストフレームワークと統合できます。
DeepEval は、手動での抜き取り確認ではなく、LLM や RAG アプリケーションの出力に対する体系的で自動化された品質チェックを求めるチームに向いています。(カタログにもある) Promptfoo を補完する存在で、両者とも LLM の評価を扱いますが、DeepEval は pytest ネイティブなユニットテストのワークフローに寄っています。
- カテゴリ
- AI・機械学習
- 言語
- Python
- ライセンス
- Apache-2.0
関連プロジェクト
Promptfoo
MITLLM のプロンプトをテスト・評価し、モデル間で出力を比較して、デプロイ前に品質の低下を検出するオープンソースツールです。
- AI・機械学習
CAMEL
Apache-2.0自律的に協調する、複数のコミュニケーションを行うロールプレイング AI エージェントのシステムを研究・構築するための、オープンソースフレームワークです。
- AI・機械学習
CrewAI
MIT役割ベースで協調して動く AI エージェントのチームを構築し、複雑なタスクを自律的に協力して完了させるためのマルチエージェントオーケストレーションフレームワークです。
- AI・機械学習
DeepSpeed
Apache-2.0非常に大規模なモデルを複数の GPU にまたがって効率的にトレーニング・実行するための、Microsoft 発の深層学習最適化ライブラリです。
- AI・機械学習
誤りを見つけましたか? GitHub で修正を提案する