섹션별 상세
라우터 모드는 OpenAI 호환 HTTP 서버인 llama-server에서 여러 모델을 동시에 관리할 수 있게 한다. 서버 시작 시 모델을 지정하지 않으면 라우터 모드로 진입하며, 캐시 디렉토리나 지정된 폴더 내의 GGUF 파일들을 자동으로 검색하여 목록화한다.
온디맨드 로딩 방식을 사용하여 특정 모델에 대한 첫 번째 API 요청이 들어올 때 해당 모델을 메모리에 로드한다. 이후 동일한 모델에 대한 요청은 이미 로드된 상태이므로 즉각적으로 처리되며, 사용자는 /models 엔드포인트를 통해 현재 로드된 모델의 상태를 확인할 수 있다.
bash
llama-server --models-dir ./my-models특정 디렉토리 내의 GGUF 모델들을 자동으로 감지하여 라우터 모드로 서버를 시작하는 명령어
bash
curl http://localhost:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "ggml-org/gemma-3-4b-it-GGUF:Q4_K_M",
"messages": [{"role": "user", "content": "Hello!"}]
}'특정 모델을 지정하여 채팅 추론을 요청하는 API 예시
멀티 프로세스 아키텍처를 기반으로 각 모델이 독립된 프로세스에서 실행된다. 이는 특정 모델이 추론 중 오류로 인해 크래시가 발생하더라도 메인 라우터 서버와 다른 모델 프로세스의 안정성을 보장하는 핵심적인 설계 요소이다.
LRU(Least Recently Used) 기반의 자동 언로드 메커니즘을 지원한다. --models-max 옵션으로 설정된 최대 로드 개수를 초과하여 새로운 모델 로드가 요청될 경우, 가장 오랫동안 사용되지 않은 모델을 자동으로 메모리에서 해제하여 VRAM 공간을 확보한다.
ini
llama-server --models-preset config.ini
[my-model]
model = /path/to/model.gguf
ctx-size = 65536
temp = 0.7프리셋 파일을 사용하여 모델별로 개별 설정을 적용하는 방법
모델별 개별 설정 기능을 제공한다. presets.ini 파일을 통해 각 모델마다 서로 다른 컨텍스트 크기(ctx-size), GPU 레이어 할당(ngl), 샘플링 파라미터 등을 정의할 수 있으며, 별도 설정이 없는 경우 서버 시작 시의 전역 설정을 상속받는다.
용어 해설
- GGUF
- — llama.cpp 프로젝트에서 개발한 대형 언어 모델 저장 포맷이다. CPU와 GPU 모두에서 효율적인 추론이 가능하도록 설계되었으며, 모델 가중치와 메타데이터를 하나의 파일에 담아 배포와 로딩이 간편하다.
- 최근 최소 사용 제거(LRU Eviction)
- — 캐시 메모리 관리 기법 중 하나로, 새로운 데이터를 로드할 공간이 부족할 때 가장 오랫동안 참조되지 않은 데이터를 먼저 삭제하는 방식이다. 이 아티클에서는 VRAM 부족 시 사용 빈도가 낮은 모델을 자동으로 언로드하는 데 사용된다.
- 멀티 프로세스 아키텍처(Multi-process Architecture)
- — 하나의 프로그램을 여러 개의 독립된 프로세스로 나누어 실행하는 구조이다. 각 프로세스가 독립된 메모리 공간을 가지므로, 특정 모델 실행 중 오류가 발생하여 프로세스가 종료되어도 메인 서버나 다른 모델 프로세스에 영향을 주지 않아 안정성이 높다.
- 비디오 램(VRAM)
- — 그래픽 카드(GPU)에 탑재된 전용 메모리이다. LLM 추론 시 모델의 가중치를 이 공간에 로드해야 빠른 연산이 가능하며, 용량이 제한적이기 때문에 여러 모델을 실행할 때 효율적인 관리가 필수적이다.
기술
- llama.cpp
- GGUF
- OpenAI API
- C++
활용 사례
- 모델 성능 비교 A/B 테스트
- 다중 모델 지원 챗봇 서비스
- 제한된 GPU 자원에서의 모델 스위칭
- 멀티 테넌트 LLM API 서버
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2025. 12. 12.수집 2026. 02. 21.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.