Zum Inhalt springen
FindOpenSource

DeepEval

Quelloffenes Test-Framework zur Bewertung von LLM-Ausgaben, das Qualitätschecks für LLM-Anwendungen wie herkömmliche Unit-Tests behandelt.

Überblick

DeepEval bietet Metriken und Test-Primitive speziell für LLM-Ausgaben – Antwortrelevanz, Treue zu Quelldokumenten, Halluzinationserkennung und mehr –, sodass ein Team automatisierte Tests für die Qualität einer LLM-Anwendung genauso schreiben kann wie Unit-Tests für gewöhnlichen Code, und sie in CI ausführen kann. Es integriert sich mit gängigen Testframeworks wie Pytest.

DeepEval eignet sich für Teams, die systematische, automatisierte Qualitätsprüfungen für LLM- oder RAG-Anwendungsausgaben statt manueller Stichproben wollen – als Ergänzung zu Promptfoo (ebenfalls in diesem Katalog): Beide adressieren LLM-Evaluation, wobei DeepEval eher zu einem pytest-nativen Unit-Test-Workflow tendiert.

Kategorien
KI & Machine Learning
Schlagwörter
llm-evaluationtestingrag-evaluation
Sprachen
Python
Lizenz
Apache-2.0

Einen Fehler entdeckt? Änderung auf GitHub vorschlagen.