llama.cpp
Implementación en C/C++ de alto rendimiento para ejecutar inferencia de LLM localmente en hardware de consumo, incluidas CPUs, con dependencias mínimas.
Descripción general
llama.cpp ejecuta grandes modelos de lenguaje de forma eficiente en hardware corriente —incluidas CPUs normales, no solo GPUs— usando técnicas de cuantización que reducen el tamaño del modelo y los requisitos de memoria con una pérdida mínima de calidad, todo en una base de código C/C++ con pocas dependencias, fácil de embeber o compilar de forma cruzada. Es el motor de inferencia sobre el que se construyen muchas herramientas de LLM local de más alto nivel.
llama.cpp encaja en desarrolladores que quieren control directo y de bajo nivel sobre el rendimiento de la inferencia de LLM local y el hardware objetivo; es el motor subyacente que Ollama (también en este catálogo) envuelve con una experiencia de configuración más amigable: los usuarios avanzados suelen recurrir directamente a llama.cpp cuando necesitan más control.
- Categorías
- IA y Machine Learning
- Palabras clave
- llm-inferencelocal-inferencequantizationmodel-serving
- Lenguajes
- C++, C
- Licencia
- MIT
Proyectos relacionados
SGLang
Apache-2.0Framework de servicio rápido para grandes modelos de lenguaje y modelos de visión-lenguaje, con un lenguaje de generación estructurada para programas LLM complejos.
- IA y Machine Learning
vLLM
Apache-2.0Motor de inferencia y servicio de alto rendimiento y eficiente en memoria para modelos de lenguaje grandes, pensado para ejecutar LLMs en producción a gran escala y no solo en una máquina local.
- IA y Machine Learning
KServe
Apache-2.0Plataforma nativa de Kubernetes para servir modelos de machine learning a gran escala, estandarizando el despliegue de modelos entre frameworks.
- IA y Machine Learning
CAMEL
Apache-2.0Framework de código abierto para investigar y construir sistemas de múltiples agentes de IA que se comunican, interpretan roles y colaboran de forma autónoma.
- IA y Machine Learning
¿Encontraste un error? Sugiere una edición en GitHub.