TL;DR
로컬에서 LLM을 실행하려면 하드웨어 제약과 툴 체인의 차이를 먼저 이해해야 한다. 로컬 인퍼런스의 진입점으로 llama.cpp를 직접 사용하는 경로가 핵심이며, LM Studio나 vLLM 같은 대안도 고려할 수 있다. 또한 Apple Silicon 환경에서는 mlx와 Metal의 차이, MoE 모델에서 RAM 대역폭의 중요성 등을 함께 점검한다. 핵심은 무엇보다도 BIOS 설정의 XMP/EXPO 활성화, MTP 예측 디더링, 양자화(QAT 포함) 및 시스템 전력 관리 조합으로 성능을 크게 끌어올릴 수 있다는 점이다. 컨텍스트 길이와 KV 캐시의 관리가 실제 TPS와 지연에 직결되며, 벤치마크를 실제 Serving 컨텍스트에서 수행해야 한다. 이 가이드는 단계별로 최적화를 시도하는 방법과 측정 지표를 함께 제시한다.
섹션별 상세
- XMP/EXPO를 BIOS에서 활성화하는 것은 MoE 추론에서 가장 큰 단일 개선 중 하나이며, RAM 대역폭의 증가로 TG가 2-3배 개선될 수 있다. — 6.1 The Memory Hierarchy
- KV 캐시 양자화(-ctk, -ctv)는 VRAM 사용량을 절반으로 줄이고 긴 컨텍스트에서 더 많은 GPU 레이어를 유지해 TG를 향상시킨다. — 11.2 KV Cache Quantization
용어 해설
- KV 캐시(KV Cache)
- — 입력 시퀀스의 키/값 어텐션 텐서를 저장해 이전 토큰들에 대한 재사용을 가능하게 하는 메모리 구조로, 컨텍스트 길이가 늘어나면 VRAM 사용이 커진다.
- MoE(Expert) 아키텍처(MoE)
- — 다수의 전문가 네트워크 중 일부를 토큰마다 선택적으로 활성화해 파라미터 효율성을 확보하는 구조로, 대형 모델의 확장성을 높인다.
- 양자화(Quantization)
- — 가중치를 저정밀도로 표현해 모델 크기와 추론 속도를 높이는 기술로, 품질 저하를 최소화하는 방법이 중요하다.
- 컨텍스트 윈도우(Context Window)
- — 한 세션에서 입력과 출력의 토큰 총합을 의미하는 창으로 KV 캐시의 크기와 메모리 사용에 직접 영향준다.
- 적합 매개변수(Llama-fit Parameters)
- — 실행 중 VRAM 여유를 추정하고 KV 캐시까지 고려한 배치를 자동으로 계산하는 도구와 플래그를 말한다.
코드 예제
git clone https://github.com/ggml-org/llama.cpp
mkdir build && cd build
cmake .. \
-DCMAKE_BUILD_TYPE=Release \
-DGGML_CUDA=ON \
-DLLAMA_CURL=ON \
-DGGML_NATIVE=ON \
-DGGML_LTO=ON \
-DGGML_CUDA_GRAPHS=ON \
-DGGML_CUDA_FA=ON \
-DGGML_CUDA_FA_ALL_QUANTS=ON \
-DCMAKE_CUDA_ARCHITECTURES=89
cmake --build . --config Release \
--target llama-server llama-bench llama-fit-params llama-cli --parallel
로컬에서 llama.cpp를 빌드하는 기본 흐름이다. CUDA가 활성화된 빌드와 필요한 바이너리 타깃을 생성한다.
기술
- llama.cpp
- LM Studio
- Ollama
- vLLM
- ggml
- CUDA
- Metal
- Apple Silicon
- MTP
- QAT
활용 사례
- 로컬 인퍼런스 서버
- 멀티유저 생산 서빙
- 벤치마크/실험적 배포
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
