Promptfoo
LLM のプロンプトをテスト・評価し、モデル間で出力を比較して、デプロイ前に品質の低下を検出するオープンソースツールです。
概要
Promptfoo は、1つ以上の LLM プロンプトやモデルに対して一連のテストケースを実行し、定義された基準に照らして出力を採点し、並べて比較表示します。そのため、チームは品質を低下させるプロンプトの変更を検出したり、同じタスクにおける異なるモデルの性能を比較したりしてから、出荷できます。既存の CI パイプラインに組み込める CLI として動作します。
Promptfoo は、プロンプトを反復改善したり LLM プロバイダーを比較したりしていて、手動での目視確認ではなくデータドリブンな評価を求めるチームに向いています。(カタログにもある) DeepEval を補完する存在で、両者とも LLM 評価をカバーしますが、Promptfoo は特にプロンプトとモデルの比較に寄っています。
- カテゴリ
- AI・機械学習
- 言語
- TypeScript
- ライセンス
- MIT
広告
関連プロジェクト
DeepEval
Apache-2.0LLM の出力を評価するためのオープンソーステストフレームワークで、LLM アプリケーションの品質チェックを従来のユニットテストのように扱います。
- AI・機械学習
CAMEL
Apache-2.0自律的に協調する、複数のコミュニケーションを行うロールプレイング AI エージェントのシステムを研究・構築するための、オープンソースフレームワークです。
- AI・機械学習
CrewAI
MIT役割ベースで協調して動く AI エージェントのチームを構築し、複雑なタスクを自律的に協力して完了させるためのマルチエージェントオーケストレーションフレームワークです。
- AI・機械学習
DeepSpeed
Apache-2.0非常に大規模なモデルを複数の GPU にまたがって効率的にトレーニング・実行するための、Microsoft 発の深層学習最適化ライブラリです。
- AI・機械学習
誤りを見つけましたか? GitHub で修正を提案する