본문으로 건너뛰기

llama.cpp 서버의 새로운 기능: 모델 관리 및 라우터 모드 도입

llama.cpp 서버에 재시작 없이 여러 GGUF 모델을 동적으로 로드, 언로드 및 라우팅할 수 있는 관리 기능이 추가되었습니다.

섹션별 상세

01
라우터 모드는 OpenAI 호환 HTTP 서버인 llama-server에서 여러 모델을 동시에 관리할 수 있게 한다. 서버 시작 시 모델을 지정하지 않으면 라우터 모드로 진입하며, 캐시 디렉토리나 지정된 폴더 내의 GGUF 파일들을 자동으로 검색하여 목록화한다.
02
온디맨드 로딩 방식을 사용하여 특정 모델에 대한 첫 번째 API 요청이 들어올 때 해당 모델을 메모리에 로드한다. 이후 동일한 모델에 대한 요청은 이미 로드된 상태이므로 즉각적으로 처리되며, 사용자는 /models 엔드포인트를 통해 현재 로드된 모델의 상태를 확인할 수 있다.
bash
llama-server --models-dir ./my-models

특정 디렉토리 내의 GGUF 모델들을 자동으로 감지하여 라우터 모드로 서버를 시작하는 명령어

bash
curl http://localhost:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "ggml-org/gemma-3-4b-it-GGUF:Q4_K_M",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

특정 모델을 지정하여 채팅 추론을 요청하는 API 예시

03
멀티 프로세스 아키텍처를 기반으로 각 모델이 독립된 프로세스에서 실행된다. 이는 특정 모델이 추론 중 오류로 인해 크래시가 발생하더라도 메인 라우터 서버와 다른 모델 프로세스의 안정성을 보장하는 핵심적인 설계 요소이다.
04
LRU(Least Recently Used) 기반의 자동 언로드 메커니즘을 지원한다. --models-max 옵션으로 설정된 최대 로드 개수를 초과하여 새로운 모델 로드가 요청될 경우, 가장 오랫동안 사용되지 않은 모델을 자동으로 메모리에서 해제하여 VRAM 공간을 확보한다.
ini
llama-server --models-preset config.ini

[my-model]
model = /path/to/model.gguf
ctx-size = 65536
temp = 0.7

프리셋 파일을 사용하여 모델별로 개별 설정을 적용하는 방법

05
모델별 개별 설정 기능을 제공한다. presets.ini 파일을 통해 각 모델마다 서로 다른 컨텍스트 크기(ctx-size), GPU 레이어 할당(ngl), 샘플링 파라미터 등을 정의할 수 있으며, 별도 설정이 없는 경우 서버 시작 시의 전역 설정을 상속받는다.

용어 해설

GGUF
llama.cpp 프로젝트에서 개발한 대형 언어 모델 저장 포맷이다. CPU와 GPU 모두에서 효율적인 추론이 가능하도록 설계되었으며, 모델 가중치와 메타데이터를 하나의 파일에 담아 배포와 로딩이 간편하다.
최근 최소 사용 제거(LRU Eviction)
캐시 메모리 관리 기법 중 하나로, 새로운 데이터를 로드할 공간이 부족할 때 가장 오랫동안 참조되지 않은 데이터를 먼저 삭제하는 방식이다. 이 아티클에서는 VRAM 부족 시 사용 빈도가 낮은 모델을 자동으로 언로드하는 데 사용된다.
멀티 프로세스 아키텍처(Multi-process Architecture)
하나의 프로그램을 여러 개의 독립된 프로세스로 나누어 실행하는 구조이다. 각 프로세스가 독립된 메모리 공간을 가지므로, 특정 모델 실행 중 오류가 발생하여 프로세스가 종료되어도 메인 서버나 다른 모델 프로세스에 영향을 주지 않아 안정성이 높다.
비디오 램(VRAM)
그래픽 카드(GPU)에 탑재된 전용 메모리이다. LLM 추론 시 모델의 가중치를 이 공간에 로드해야 빠른 연산이 가능하며, 용량이 제한적이기 때문에 여러 모델을 실행할 때 효율적인 관리가 필수적이다.

기술

  • llama.cpp
  • GGUF
  • OpenAI API
  • C++

활용 사례

  • 모델 성능 비교 A/B 테스트
  • 다중 모델 지원 챗봇 서비스
  • 제한된 GPU 자원에서의 모델 스위칭
  • 멀티 테넌트 LLM API 서버

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2025. 12. 12.수집 2026. 02. 21.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.