Zum Inhalt springen
FindOpenSource

llama.cpp

Hochperformante C/C++-Implementierung zum lokalen Ausführen von LLM-Inferenz auf Consumer-Hardware, einschließlich CPUs, mit minimalen Abhängigkeiten.

Überblick

llama.cpp führt große Sprachmodelle effizient auf gewöhnlicher Hardware aus – einschließlich reiner CPUs, nicht nur GPUs – mithilfe von Quantisierungstechniken, die Modellgröße und Speicherbedarf bei minimalem Qualitätsverlust verringern, alles in einer abhängigkeitsarmen C/C++-Codebasis, die sich leicht einbetten oder cross-kompilieren lässt. Es ist die Inferenz-Engine, auf der viele höherstufige lokale LLM-Tools aufbauen.

llama.cpp eignet sich für Entwickler, die direkte, niedrigstufige Kontrolle über lokale LLM-Inferenz-Performance und Hardware-Ausrichtung wollen – die zugrunde liegende Engine, die Ollama (ebenfalls in diesem Katalog) mit einer freundlicheren Einrichtungserfahrung umhüllt; Power-User greifen oft direkt zu llama.cpp, wenn sie mehr Kontrolle benötigen.

Kategorien
KI & Machine Learning
Schlagwörter
llm-inferencelocal-inferencequantizationmodel-serving
Sprachen
C++, C
Lizenz
MIT

Einen Fehler entdeckt? Änderung auf GitHub vorschlagen.