llama.cpp
CPU를 포함한 소비자용 하드웨어에서 최소한의 의존성으로 LLM 추론을 로컬에서 실행하는 고성능 C/C++ 구현체입니다.
개요
llama.cpp는 GPU뿐 아니라 일반 CPU를 포함한 평범한 하드웨어에서 대규모 언어 모델을 효율적으로 실행하며, 품질 손실을 최소화하면서 모델 크기와 메모리 요구량을 줄이는 양자화 기법을 사용합니다. 모든 것이 의존성이 적은 C/C++ 코드베이스로 되어 있어 임베딩이나 크로스 컴파일이 쉽습니다. 많은 상위 수준 로컬 LLM 도구들이 기반으로 삼는 추론 엔진입니다.
llama.cpp는 로컬 LLM 추론 성능과 하드웨어 타겟팅에 대해 직접적이고 저수준의 제어를 원하는 개발자에게 적합하며, (카탈로그에 있는) Ollama가 더 친절한 설정 경험으로 감싸는 기반 엔진입니다 — 파워 유저는 더 많은 제어가 필요할 때 흔히 llama.cpp를 직접 사용합니다.
- 카테고리
- AI 및 머신러닝
- 언어
- C++, C
- 라이선스
- MIT
관련 프로젝트
SGLang
Apache-2.0복잡한 LLM 프로그램을 위한 구조화된 생성 언어를 갖춘, 대규모 언어 모델과 비전-언어 모델을 위한 빠른 서빙 프레임워크입니다.
- AI 및 머신러닝
vLLM
Apache-2.0대규모 언어 모델을 위한 고처리량·메모리 효율적인 추론·서빙 엔진으로, 단일 로컬 머신이 아니라 프로덕션 환경에서 대규모로 LLM을 운영하기 위해 만들어졌습니다.
- AI 및 머신러닝
KServe
Apache-2.0대규모로 머신러닝 모델을 서빙하기 위한 Kubernetes 네이티브 플랫폼으로, 프레임워크 전반에 걸쳐 모델 배포를 표준화합니다.
- AI 및 머신러닝
CAMEL
Apache-2.0자율적으로 협업하는, 여러 개의 소통하는 역할극 AI 에이전트 시스템을 연구하고 구축하기 위한 오픈소스 프레임워크입니다.
- AI 및 머신러닝
잘못된 정보를 발견하셨나요? GitHub에서 수정 제안하기