llama.cpp
高性能 C/C++ 实现,用于在消费级硬件(包括 CPU)上本地运行大语言模型推理,依赖极少。
概述
llama.cpp 能在普通硬件——包括纯 CPU,而不仅限于 GPU——上高效运行大语言模型,采用量化技术在几乎不损失质量的情况下缩减模型体积和内存需求,整个代码库以轻依赖的 C/C++ 编写,易于嵌入或交叉编译。它是许多更高层本地大语言模型工具背后所依赖的推理引擎。
llama.cpp 适合那些希望对本地大语言模型推理性能和硬件适配拥有直接、底层控制权的开发者,是目录中 Ollama 以更友好的搭建体验进行封装的底层引擎——高级用户在需要更多控制权时,常常会直接选用 llama.cpp。
- 分类
- AI 与机器学习
- 编程语言
- C++, C
- 许可证
- MIT
广告
相关项目
发现信息有误?在 GitHub 上提出修改建议。