llama.cpp
Hochperformante C/C++-Implementierung zum lokalen Ausführen von LLM-Inferenz auf Consumer-Hardware, einschließlich CPUs, mit minimalen Abhängigkeiten.
Überblick
llama.cpp führt große Sprachmodelle effizient auf gewöhnlicher Hardware aus – einschließlich reiner CPUs, nicht nur GPUs – mithilfe von Quantisierungstechniken, die Modellgröße und Speicherbedarf bei minimalem Qualitätsverlust verringern, alles in einer abhängigkeitsarmen C/C++-Codebasis, die sich leicht einbetten oder cross-kompilieren lässt. Es ist die Inferenz-Engine, auf der viele höherstufige lokale LLM-Tools aufbauen.
llama.cpp eignet sich für Entwickler, die direkte, niedrigstufige Kontrolle über lokale LLM-Inferenz-Performance und Hardware-Ausrichtung wollen – die zugrunde liegende Engine, die Ollama (ebenfalls in diesem Katalog) mit einer freundlicheren Einrichtungserfahrung umhüllt; Power-User greifen oft direkt zu llama.cpp, wenn sie mehr Kontrolle benötigen.
- Kategorien
- KI & Machine Learning
- Sprachen
- C++, C
- Lizenz
- MIT
Ähnliche Projekte
SGLang
Apache-2.0Schnelles Serving-Framework für große Sprachmodelle und Vision-Language-Modelle mit einer strukturierten Generierungssprache für komplexe LLM-Programme.
- KI & Machine Learning
vLLM
Apache-2.0Durchsatzstarke, speichereffiziente Inferenz- und Serving-Engine für große Sprachmodelle, gebaut für den Betrieb von LLMs im großen Maßstab in Produktion statt nur auf einer einzelnen lokalen Maschine.
- KI & Machine Learning
KServe
Apache-2.0Kubernetes-native Plattform zum Servieren von Machine-Learning-Modellen im großen Maßstab, die das Modell-Deployment über Frameworks hinweg standardisiert.
- KI & Machine Learning
CAMEL
Apache-2.0Open-Source-Framework für Forschung und den Bau von Systemen mehrerer kommunizierender, rollenspielender KI-Agenten, die autonom zusammenarbeiten.
- KI & Machine Learning
Einen Fehler entdeckt? Änderung auf GitHub vorschlagen.