llama.cpp
CPU を含むコンシューマー向けハードウェア上でローカルに LLM 推論を実行するための、依存関係の少ない高性能な C/C++ 実装です。
概要
llama.cpp は、GPU だけでなく普通の CPU を含む一般的なハードウェア上で、大規模言語モデルを効率的に動作させます。モデルサイズとメモリ要件を、品質の低下を最小限に抑えながら縮小する量子化技術を使い、すべて依存関係の少ない C/C++ のコードベースで実装されているため、組み込みやクロスコンパイルが容易です。多くのより高レベルなローカル LLM ツールが、その基盤として利用している推論エンジンです。
llama.cpp は、ローカルでの LLM 推論パフォーマンスやハードウェアのターゲティングを直接的かつ低レベルに制御したい開発者に向いています。(カタログにもある) Ollama がより親しみやすいセットアップ体験でラップしている基盤エンジンであり、より高い制御を必要とするパワーユーザーは、しばしば llama.cpp を直接使用します。
- カテゴリ
- AI・機械学習
- 言語
- C++, C
- ライセンス
- MIT
関連プロジェクト
SGLang
Apache-2.0大規模言語モデルやビジョン言語モデル向けの高速サービングフレームワークで、複雑な LLM プログラムのための構造化された生成言語を備えています。
- AI・機械学習
vLLM
Apache-2.0大規模言語モデル向けの高スループットでメモリ効率に優れた推論・サービングエンジンで、単一のローカルマシンではなく、本番環境で大規模に LLM を運用するために作られています。
- AI・機械学習
KServe
Apache-2.0機械学習モデルを大規模にサービングするための Kubernetes ネイティブなプラットフォームで、フレームワークをまたいでモデルのデプロイを標準化します。
- AI・機械学習
CAMEL
Apache-2.0自律的に協調する、複数のコミュニケーションを行うロールプレイング AI エージェントのシステムを研究・構築するための、オープンソースフレームワークです。
- AI・機械学習
誤りを見つけましたか? GitHub で修正を提案する