Saltar al contenido
FindOpenSource

DeepEval

Framework de pruebas de código abierto para evaluar salidas de LLM, tratando las comprobaciones de calidad de aplicaciones LLM como tests unitarios convencionales.

Descripción general

DeepEval ofrece métricas y primitivas de prueba específicas para salidas de LLM —relevancia de la respuesta, fidelidad a los documentos fuente, detección de alucinaciones y más— para que un equipo pueda escribir pruebas automatizadas de la calidad de una aplicación LLM de la misma forma que escribiría tests unitarios para código normal, y ejecutarlas en CI. Se integra con frameworks de pruebas habituales como Pytest.

DeepEval encaja en equipos que quieren comprobaciones de calidad sistemáticas y automatizadas sobre las salidas de aplicaciones LLM o RAG en lugar de revisiones manuales puntuales, complementando a Promptfoo (también en este catálogo): ambos abordan la evaluación de LLM, con DeepEval inclinándose hacia un flujo de trabajo de pruebas unitarias nativo de pytest.

Categorías
IA y Machine Learning
Palabras clave
llm-evaluationtestingrag-evaluation
Lenguajes
Python
Licencia
Apache-2.0

¿Encontraste un error? Sugiere una edición en GitHub.