DeepEval
Framework de pruebas de código abierto para evaluar salidas de LLM, tratando las comprobaciones de calidad de aplicaciones LLM como tests unitarios convencionales.
Descripción general
DeepEval ofrece métricas y primitivas de prueba específicas para salidas de LLM —relevancia de la respuesta, fidelidad a los documentos fuente, detección de alucinaciones y más— para que un equipo pueda escribir pruebas automatizadas de la calidad de una aplicación LLM de la misma forma que escribiría tests unitarios para código normal, y ejecutarlas en CI. Se integra con frameworks de pruebas habituales como Pytest.
DeepEval encaja en equipos que quieren comprobaciones de calidad sistemáticas y automatizadas sobre las salidas de aplicaciones LLM o RAG en lugar de revisiones manuales puntuales, complementando a Promptfoo (también en este catálogo): ambos abordan la evaluación de LLM, con DeepEval inclinándose hacia un flujo de trabajo de pruebas unitarias nativo de pytest.
- Categorías
- IA y Machine Learning
- Palabras clave
- llm-evaluationtestingrag-evaluation
- Lenguajes
- Python
- Licencia
- Apache-2.0
Proyectos relacionados
Promptfoo
MITHerramienta de código abierto para probar y evaluar prompts de LLM, comparando salidas entre modelos y detectando regresiones de calidad antes del despliegue.
- IA y Machine Learning
CAMEL
Apache-2.0Framework de código abierto para investigar y construir sistemas de múltiples agentes de IA que se comunican, interpretan roles y colaboran de forma autónoma.
- IA y Machine Learning
CrewAI
MITFramework de orquestación multiagente para construir equipos de agentes de IA colaborativos y basados en roles que trabajan juntos de forma autónoma para completar tareas complejas.
- IA y Machine Learning
DeepSpeed
Apache-2.0Biblioteca de optimización de deep learning de Microsoft para entrenar y ejecutar modelos muy grandes de forma eficiente en múltiples GPUs.
- IA y Machine Learning
¿Encontraste un error? Sugiere una edición en GitHub.