コンテンツへスキップ
FindOpenSource

Promptfoo

LLM のプロンプトをテスト・評価し、モデル間で出力を比較して、デプロイ前に品質の低下を検出するオープンソースツールです。

概要

Promptfoo は、1つ以上の LLM プロンプトやモデルに対して一連のテストケースを実行し、定義された基準に照らして出力を採点し、並べて比較表示します。そのため、チームは品質を低下させるプロンプトの変更を検出したり、同じタスクにおける異なるモデルの性能を比較したりしてから、出荷できます。既存の CI パイプラインに組み込める CLI として動作します。

Promptfoo は、プロンプトを反復改善したり LLM プロバイダーを比較したりしていて、手動での目視確認ではなくデータドリブンな評価を求めるチームに向いています。(カタログにもある) DeepEval を補完する存在で、両者とも LLM 評価をカバーしますが、Promptfoo は特にプロンプトとモデルの比較に寄っています。

カテゴリ
AI・機械学習
キーワード
llm-evaluationprompt-testingmodel-comparison
言語
TypeScript
ライセンス
MIT

誤りを見つけましたか? GitHub で修正を提案する