본문으로 건너뛰기
FindOpenSource

vLLM

대규모 언어 모델을 위한 고처리량·메모리 효율적인 추론·서빙 엔진으로, 단일 로컬 머신이 아니라 프로덕션 환경에서 대규모로 LLM을 운영하기 위해 만들어졌습니다.

개요

vLLM은 빠른 LLM 추론과 서빙을 위한 라이브러리로, 원래 UC 버클리의 Sky Computing Lab에서 개발되었으며 지금은 대규모 오픈소스 커뮤니티가 유지 관리하고 있습니다. 핵심 기여는 PagedAttention으로, 어텐션 메커니즘의 키-값 캐시에 대한 메모리 관리 기법인데, 단순한 서빙 방식에 비해 동일한 GPU 하드웨어에서 훨씬 더 많은 동시 요청을 처리할 수 있게 해줍니다. 여기에 연속 배치 처리(continuous batching)를 결합해, 배치가 다 찰 때까지 기다리지 않고 들어오는 요청을 효율적으로 처리합니다.

OpenAI 호환 API 서버를 제공하며, Hugging Face의 다양한 오픈 웨이트 모델을 지원하고, 처리량과 지연 시간을 더 다듬을 수 있는 양자화 및 추측 디코딩(speculative decoding) 옵션도 포함합니다.

vLLM은 LLM을 프로덕션 서비스로 배포하면서 많은 동시 사용자를 효율적으로 처리해야 하는 팀에 적합합니다. 카탈로그에 있는 Ollama와는 다른 계층으로, Ollama는 고처리량 다중 요청 서빙이 아니라 단일 사용자를 위해 로컬에서 모델을 실행하도록 만들어졌습니다.

카테고리
AI 및 머신러닝
키워드
llm-inferencemodel-servingllm-servinggpu-inference
언어
Python, CUDA
라이선스
Apache-2.0

잘못된 정보를 발견하셨나요? GitHub에서 수정 제안하기