跳至内容
FindOpenSource

llama.cpp

高性能 C/C++ 实现,用于在消费级硬件(包括 CPU)上本地运行大语言模型推理,依赖极少。

概述

llama.cpp 能在普通硬件——包括纯 CPU,而不仅限于 GPU——上高效运行大语言模型,采用量化技术在几乎不损失质量的情况下缩减模型体积和内存需求,整个代码库以轻依赖的 C/C++ 编写,易于嵌入或交叉编译。它是许多更高层本地大语言模型工具背后所依赖的推理引擎。

llama.cpp 适合那些希望对本地大语言模型推理性能和硬件适配拥有直接、底层控制权的开发者,是目录中 Ollama 以更友好的搭建体验进行封装的底层引擎——高级用户在需要更多控制权时,常常会直接选用 llama.cpp。

分类
AI 与机器学习
关键词
llm-inferencelocal-inferencequantizationmodel-serving
编程语言
C++, C
许可证
MIT

发现信息有误?在 GitHub 上提出修改建议