Saltar al contenido
FindOpenSource

vLLM

Motor de inferencia y servicio de alto rendimiento y eficiente en memoria para modelos de lenguaje grandes, pensado para ejecutar LLMs en producción a gran escala y no solo en una máquina local.

Descripción general

vLLM es una biblioteca para inferencia y servicio rápido de LLMs, desarrollada originalmente en el Sky Computing Lab de UC Berkeley y mantenida ahora por una gran comunidad de código abierto. Su aportación principal es PagedAttention, una técnica de gestión de memoria para la caché de clave-valor del mecanismo de atención que permite atender muchas más peticiones concurrentes en el mismo hardware de GPU que los enfoques de servicio ingenuos, combinada con batching continuo para que las peticiones entrantes se procesen de forma eficiente a medida que llegan, en lugar de esperar a completar un lote.

Expone un servidor de API compatible con OpenAI, admite una amplia variedad de modelos de pesos abiertos de Hugging Face, e incluye opciones de cuantización y decodificación especulativa para ajustar aún más el rendimiento y la latencia.

vLLM encaja en equipos que despliegan LLMs como servicio en producción y necesitan atender a muchos usuarios concurrentes de forma eficiente, un nivel distinto al de Ollama (también en este catálogo), que está pensado para ejecutar un modelo localmente para un solo usuario en lugar de servir múltiples peticiones con alto rendimiento.

Categorías
IA y Machine Learning
Palabras clave
llm-inferencemodel-servingllm-servinggpu-inference
Lenguajes
Python, CUDA
Licencia
Apache-2.0

¿Encontraste un error? Sugiere una edición en GitHub.