vLLM
Motor de inferencia y servicio de alto rendimiento y eficiente en memoria para modelos de lenguaje grandes, pensado para ejecutar LLMs en producción a gran escala y no solo en una máquina local.
Descripción general
vLLM es una biblioteca para inferencia y servicio rápido de LLMs, desarrollada originalmente en el Sky Computing Lab de UC Berkeley y mantenida ahora por una gran comunidad de código abierto. Su aportación principal es PagedAttention, una técnica de gestión de memoria para la caché de clave-valor del mecanismo de atención que permite atender muchas más peticiones concurrentes en el mismo hardware de GPU que los enfoques de servicio ingenuos, combinada con batching continuo para que las peticiones entrantes se procesen de forma eficiente a medida que llegan, en lugar de esperar a completar un lote.
Expone un servidor de API compatible con OpenAI, admite una amplia variedad de modelos de pesos abiertos de Hugging Face, e incluye opciones de cuantización y decodificación especulativa para ajustar aún más el rendimiento y la latencia.
vLLM encaja en equipos que despliegan LLMs como servicio en producción y necesitan atender a muchos usuarios concurrentes de forma eficiente, un nivel distinto al de Ollama (también en este catálogo), que está pensado para ejecutar un modelo localmente para un solo usuario en lugar de servir múltiples peticiones con alto rendimiento.
- Categorías
- IA y Machine Learning
- Palabras clave
- llm-inferencemodel-servingllm-servinggpu-inference
- Lenguajes
- Python, CUDA
- Licencia
- Apache-2.0
Proyectos relacionados
llama.cpp
MITImplementación en C/C++ de alto rendimiento para ejecutar inferencia de LLM localmente en hardware de consumo, incluidas CPUs, con dependencias mínimas.
- IA y Machine Learning
SGLang
Apache-2.0Framework de servicio rápido para grandes modelos de lenguaje y modelos de visión-lenguaje, con un lenguaje de generación estructurada para programas LLM complejos.
- IA y Machine Learning
KServe
Apache-2.0Plataforma nativa de Kubernetes para servir modelos de machine learning a gran escala, estandarizando el despliegue de modelos entre frameworks.
- IA y Machine Learning
CAMEL
Apache-2.0Framework de código abierto para investigar y construir sistemas de múltiples agentes de IA que se comunican, interpretan roles y colaboran de forma autónoma.
- IA y Machine Learning
¿Encontraste un error? Sugiere una edición en GitHub.