vLLM
Durchsatzstarke, speichereffiziente Inferenz- und Serving-Engine für große Sprachmodelle, gebaut für den Betrieb von LLMs im großen Maßstab in Produktion statt nur auf einer einzelnen lokalen Maschine.
Überblick
vLLM ist eine Bibliothek für schnelle LLM-Inferenz und -Serving, ursprünglich am Sky Computing Lab der UC Berkeley entwickelt und heute von einer großen Open-Source-Community gepflegt. Der zentrale Beitrag ist PagedAttention, eine Speicherverwaltungstechnik für den Key-Value-Cache des Attention-Mechanismus, die es ermöglicht, auf derselben GPU-Hardware weitaus mehr gleichzeitige Anfragen zu bedienen als naive Serving-Ansätze – kombiniert mit kontinuierlichem Batching, sodass eingehende Anfragen effizient verarbeitet werden, sobald sie eintreffen, statt auf einen vollen Batch zu warten.
Es stellt einen OpenAI-kompatiblen API-Server bereit, unterstützt eine breite Palette offener Modelle von Hugging Face und bietet Quantisierung sowie spekulatives Decoding zur weiteren Optimierung von Durchsatz und Latenz.
vLLM eignet sich für Teams, die LLMs als Produktionsdienst bereitstellen und viele gleichzeitige Nutzer effizient bedienen müssen – eine andere Ebene als Ollama (ebenfalls in diesem Katalog), das für den lokalen Betrieb eines Modells für einen einzelnen Nutzer gebaut ist und nicht für durchsatzstarkes Multi-Request-Serving.
- Kategorien
- KI & Machine Learning
- Sprachen
- Python, CUDA
- Lizenz
- Apache-2.0
Ähnliche Projekte
llama.cpp
MITHochperformante C/C++-Implementierung zum lokalen Ausführen von LLM-Inferenz auf Consumer-Hardware, einschließlich CPUs, mit minimalen Abhängigkeiten.
- KI & Machine Learning
SGLang
Apache-2.0Schnelles Serving-Framework für große Sprachmodelle und Vision-Language-Modelle mit einer strukturierten Generierungssprache für komplexe LLM-Programme.
- KI & Machine Learning
KServe
Apache-2.0Kubernetes-native Plattform zum Servieren von Machine-Learning-Modellen im großen Maßstab, die das Modell-Deployment über Frameworks hinweg standardisiert.
- KI & Machine Learning
CAMEL
Apache-2.0Open-Source-Framework für Forschung und den Bau von Systemen mehrerer kommunizierender, rollenspielender KI-Agenten, die autonom zusammenarbeiten.
- KI & Machine Learning
Einen Fehler entdeckt? Änderung auf GitHub vorschlagen.