본문으로 건너뛰기
FindOpenSource

llama.cpp

CPU를 포함한 소비자용 하드웨어에서 최소한의 의존성으로 LLM 추론을 로컬에서 실행하는 고성능 C/C++ 구현체입니다.

개요

llama.cpp는 GPU뿐 아니라 일반 CPU를 포함한 평범한 하드웨어에서 대규모 언어 모델을 효율적으로 실행하며, 품질 손실을 최소화하면서 모델 크기와 메모리 요구량을 줄이는 양자화 기법을 사용합니다. 모든 것이 의존성이 적은 C/C++ 코드베이스로 되어 있어 임베딩이나 크로스 컴파일이 쉽습니다. 많은 상위 수준 로컬 LLM 도구들이 기반으로 삼는 추론 엔진입니다.

llama.cpp는 로컬 LLM 추론 성능과 하드웨어 타겟팅에 대해 직접적이고 저수준의 제어를 원하는 개발자에게 적합하며, (카탈로그에 있는) Ollama가 더 친절한 설정 경험으로 감싸는 기반 엔진입니다 — 파워 유저는 더 많은 제어가 필요할 때 흔히 llama.cpp를 직접 사용합니다.

카테고리
AI 및 머신러닝
키워드
llm-inferencelocal-inferencequantizationmodel-serving
언어
C++, C
라이선스
MIT

잘못된 정보를 발견하셨나요? GitHub에서 수정 제안하기