Promptfoo
Open-Source-Tool zum Testen und Bewerten von LLM-Prompts, das Ausgaben über Modelle hinweg vergleicht und Qualitätsregressionen vor dem Deployment erkennt.
Überblick
Promptfoo führt eine Reihe von Testfällen gegen einen oder mehrere LLM-Prompts oder -Modelle aus, bewertet Ausgaben anhand definierter Kriterien und zeigt Seite-an-Seite-Vergleiche – sodass ein Team eine Prompt-Änderung erkennen kann, die die Qualität verschlechtert, oder vergleichen kann, wie verschiedene Modelle bei derselben Aufgabe abschneiden, bevor ausgeliefert wird. Es funktioniert als CLI, die in bestehende CI-Pipelines passt.
Promptfoo eignet sich für Teams, die an Prompts iterieren oder LLM-Anbieter vergleichen und eine datengetriebene Bewertung statt manueller Sichtprüfung wollen – als Ergänzung zu DeepEval (ebenfalls in diesem Katalog): Beide decken LLM-Evaluation ab, wobei Promptfoo eher zu Prompt- und Modellvergleich speziell tendiert.
- Kategorien
- KI & Machine Learning
- Schlagwörter
- llm-evaluationprompt-testingmodel-comparison
- Sprachen
- TypeScript
- Lizenz
- MIT
Ähnliche Projekte
DeepEval
Apache-2.0Quelloffenes Test-Framework zur Bewertung von LLM-Ausgaben, das Qualitätschecks für LLM-Anwendungen wie herkömmliche Unit-Tests behandelt.
- KI & Machine Learning
CAMEL
Apache-2.0Open-Source-Framework für Forschung und den Bau von Systemen mehrerer kommunizierender, rollenspielender KI-Agenten, die autonom zusammenarbeiten.
- KI & Machine Learning
CrewAI
MITMulti-Agent-Orchestrierungs-Framework zum Aufbau von Teams kollaborierender, rollenbasierter KI-Agenten, die autonom zusammenarbeiten, um komplexe Aufgaben zu erledigen.
- KI & Machine Learning
DeepSpeed
Apache-2.0Deep-Learning-Optimierungsbibliothek von Microsoft zum effizienten Trainieren und Ausführen sehr großer Modelle über mehrere GPUs hinweg.
- KI & Machine Learning
Einen Fehler entdeckt? Änderung auf GitHub vorschlagen.