DeepEval
Quelloffenes Test-Framework zur Bewertung von LLM-Ausgaben, das Qualitätschecks für LLM-Anwendungen wie herkömmliche Unit-Tests behandelt.
Überblick
DeepEval bietet Metriken und Test-Primitive speziell für LLM-Ausgaben – Antwortrelevanz, Treue zu Quelldokumenten, Halluzinationserkennung und mehr –, sodass ein Team automatisierte Tests für die Qualität einer LLM-Anwendung genauso schreiben kann wie Unit-Tests für gewöhnlichen Code, und sie in CI ausführen kann. Es integriert sich mit gängigen Testframeworks wie Pytest.
DeepEval eignet sich für Teams, die systematische, automatisierte Qualitätsprüfungen für LLM- oder RAG-Anwendungsausgaben statt manueller Stichproben wollen – als Ergänzung zu Promptfoo (ebenfalls in diesem Katalog): Beide adressieren LLM-Evaluation, wobei DeepEval eher zu einem pytest-nativen Unit-Test-Workflow tendiert.
- Kategorien
- KI & Machine Learning
- Schlagwörter
- llm-evaluationtestingrag-evaluation
- Sprachen
- Python
- Lizenz
- Apache-2.0
Ähnliche Projekte
Promptfoo
MITOpen-Source-Tool zum Testen und Bewerten von LLM-Prompts, das Ausgaben über Modelle hinweg vergleicht und Qualitätsregressionen vor dem Deployment erkennt.
- KI & Machine Learning
CAMEL
Apache-2.0Open-Source-Framework für Forschung und den Bau von Systemen mehrerer kommunizierender, rollenspielender KI-Agenten, die autonom zusammenarbeiten.
- KI & Machine Learning
CrewAI
MITMulti-Agent-Orchestrierungs-Framework zum Aufbau von Teams kollaborierender, rollenbasierter KI-Agenten, die autonom zusammenarbeiten, um komplexe Aufgaben zu erledigen.
- KI & Machine Learning
DeepSpeed
Apache-2.0Deep-Learning-Optimierungsbibliothek von Microsoft zum effizienten Trainieren und Ausführen sehr großer Modelle über mehrere GPUs hinweg.
- KI & Machine Learning
Einen Fehler entdeckt? Änderung auf GitHub vorschlagen.