Saltar al contenido
FindOpenSource

llama.cpp

Implementación en C/C++ de alto rendimiento para ejecutar inferencia de LLM localmente en hardware de consumo, incluidas CPUs, con dependencias mínimas.

Descripción general

llama.cpp ejecuta grandes modelos de lenguaje de forma eficiente en hardware corriente —incluidas CPUs normales, no solo GPUs— usando técnicas de cuantización que reducen el tamaño del modelo y los requisitos de memoria con una pérdida mínima de calidad, todo en una base de código C/C++ con pocas dependencias, fácil de embeber o compilar de forma cruzada. Es el motor de inferencia sobre el que se construyen muchas herramientas de LLM local de más alto nivel.

llama.cpp encaja en desarrolladores que quieren control directo y de bajo nivel sobre el rendimiento de la inferencia de LLM local y el hardware objetivo; es el motor subyacente que Ollama (también en este catálogo) envuelve con una experiencia de configuración más amigable: los usuarios avanzados suelen recurrir directamente a llama.cpp cuando necesitan más control.

Categorías
IA y Machine Learning
Palabras clave
llm-inferencelocal-inferencequantizationmodel-serving
Lenguajes
C++, C
Licencia
MIT

¿Encontraste un error? Sugiere una edición en GitHub.