跳至内容
FindOpenSource

vLLM

高吞吐、内存高效的大语言模型推理与服务引擎,专为大规模生产环境中运行 LLM 而设计,而非仅用于单机本地运行。

概述

vLLM 是一个用于快速 LLM 推理与服务的库,最初由加州大学伯克利分校 Sky Computing Lab 开发,现由庞大的开源社区维护。它的核心贡献是 PagedAttention——一种针对注意力机制键值缓存的内存管理技术,相比朴素的服务方式,能在相同的 GPU 硬件上支持多得多的并发请求;再结合连续批处理(continuous batching),使新到达的请求能够高效处理,而不必等待凑够一整批。

它对外暴露与 OpenAI 兼容的 API 服务,支持来自 Hugging Face 的广泛开放权重模型,并提供量化和推测解码(speculative decoding)等选项,用于进一步调优吞吐量和延迟。

vLLM 适合那些将 LLM 部署为生产服务、需要高效处理大量并发用户的团队——这与目录中的 Ollama 属于不同层级:Ollama 是为单一用户在本地运行模型而构建的,而不是面向高吞吐、多请求并发的服务场景。

分类
AI 与机器学习
关键词
llm-inferencemodel-servingllm-servinggpu-inference
编程语言
Python, CUDA
许可证
Apache-2.0

发现信息有误?在 GitHub 上提出修改建议