"llm-serving" 검색 결과 1건
대규모 언어 모델을 위한 고처리량·메모리 효율적인 추론·서빙 엔진으로, 단일 로컬 머신이 아니라 프로덕션 환경에서 대규모로 LLM을 운영하기 위해 만들어졌습니다.