Promptfoo
Herramienta de código abierto para probar y evaluar prompts de LLM, comparando salidas entre modelos y detectando regresiones de calidad antes del despliegue.
Descripción general
Promptfoo ejecuta un conjunto de casos de prueba contra uno o varios prompts o modelos de LLM, puntuando las salidas según criterios definidos y mostrando comparaciones lado a lado, para que un equipo pueda detectar un cambio de prompt que degrade la calidad, o comparar cómo rinden distintos modelos en la misma tarea, antes de lanzar. Funciona como una CLI que encaja en pipelines de CI existentes.
Promptfoo encaja en equipos que iteran sobre prompts o comparan proveedores de LLM y quieren una evaluación basada en datos en lugar de una revisión visual manual, complementando a DeepEval (también en este catálogo): ambos cubren la evaluación de LLM, con Promptfoo inclinándose específicamente hacia la comparación de prompts y modelos.
- Categorías
- IA y Machine Learning
- Palabras clave
- llm-evaluationprompt-testingmodel-comparison
- Lenguajes
- TypeScript
- Licencia
- MIT
Proyectos relacionados
DeepEval
Apache-2.0Framework de pruebas de código abierto para evaluar salidas de LLM, tratando las comprobaciones de calidad de aplicaciones LLM como tests unitarios convencionales.
- IA y Machine Learning
CAMEL
Apache-2.0Framework de código abierto para investigar y construir sistemas de múltiples agentes de IA que se comunican, interpretan roles y colaboran de forma autónoma.
- IA y Machine Learning
CrewAI
MITFramework de orquestación multiagente para construir equipos de agentes de IA colaborativos y basados en roles que trabajan juntos de forma autónoma para completar tareas complejas.
- IA y Machine Learning
DeepSpeed
Apache-2.0Biblioteca de optimización de deep learning de Microsoft para entrenar y ejecutar modelos muy grandes de forma eficiente en múltiples GPUs.
- IA y Machine Learning
¿Encontraste un error? Sugiere una edición en GitHub.