TL;DR
게시자는 Windows의 16GB VRAM 환경에서 Qwen3.8-27B-Uncensored-IQ4-XS-MTP-16GB-VRAM-GGUF를 llama-server로 실행하는 구성을 공유합니다. MTP와 mmproj를 CPU와 RAM으로 보내고 Q4 K·Q4 V 캐시를 사용해 Windows가 차지하는 약 1.5GB의 VRAM 부담을 우회합니다. 컨텍스트는 100,100 토큰으로 지정하고 RAM 캐시 24,576과 컨텍스트 체크포인트 32개를 설정하지만, 100k를 넘으면 context rot이 생길 수 있다고 밝힙니다. 배치 크기와 마이크로 배치 크기를 낮춰 VRAM 급증을 줄이고, `--no-context-shift`로 컨텍스트 이동에 따른 정지 문제를 피하려는 구성이 핵심입니다.
실용적 조언
- Windows에서 16GB VRAM으로 해당 GGUF를 실행할 때는 `--cache-type-k q4_0`과 `--cache-type-v q4_0`를 사용하고, mmproj와 MTP 관련 텐서를 CPU와 RAM으로 보내는 구성을 우선 적용할 수 있습니다.
- 긴 컨텍스트를 지정하더라도 약 100k 이상에서는 context rot이 발생할 수 있으므로 `-c 100100`처럼 실제 하드웨어에서 적합성을 확인한 뒤 상한을 정하는 방식이 필요합니다.
섹션별 상세
용어 해설
- 다음 토큰 예측(MTP)
- — MTP는 모델이 현재 토큰 다음의 토큰을 한 개만 예측하지 않고 여러 미래 토큰까지 함께 예측하는 처리 방식입니다. 이 게시물에서는 VRAM을 아끼기 위해 MTP 기능을 끈 상태로 모델을 실행합니다.
- GGUF 모델 형식(GGUF)
- — GGUF는 양자화된 LLM 가중치와 실행에 필요한 메타데이터를 하나의 파일에 저장하는 형식입니다. 게시물에서는 Q4 계열로 줄인 Qwen 모델을 GGUF 파일로 llama-server에 입력합니다.
- 멀티모달 프로젝터(mmproj)
- — mmproj는 이미지 입력을 언어 모델이 처리할 수 있는 표현으로 변환하는 구성 요소입니다. 게시물에서는 mmproj를 GPU 대신 CPU와 RAM에 배치해 약 800~900MB의 VRAM을 절약하려고 합니다.
- 컨텍스트 윈도(Context Window)
- — 컨텍스트 윈도는 모델이 한 번에 유지하고 처리하는 입력 토큰 범위입니다. 게시물의 설정은 약 100,100 토큰을 지정하지만, 100k를 넘기면 context rot이 나타날 수 있다고 적습니다.
- 컨텍스트 체크포인트(Context Checkpoints)
- — 컨텍스트 체크포인트는 긴 대화의 상태를 저장해 이후 처리에서 재사용하는 실행 설정입니다. 게시물은 RAM에 캐시 공간을 확보하고 32개의 체크포인트를 지정해 컨텍스트 슬롯 상태를 보존하려고 합니다.
코드 예제
.\ikllama\llama-server.exe ^
-m "D:\AI models\qwen3.8\Qwen3.8-27B-Uncensored-IQ4-XS-MTP-16GB-VRAM-GGUF.gguf" ^
:: gpu offload all layers (99 is more than the max)
-ngl 99 ^
:: this depends on your cpu
-t 8 ^
:: literally can't fit in anything at higher q to save vram
--cache-type-k q4_0 ^
--cache-type-v q4_0 ^
:: check your max context size with fit, at around >100k context rot sets in
-c 100100 ^
:: this flag should always be on to optimise speed and memory use
-fa on ^
:: You need a fixed jinja file to prevent it rambling forever, I believe this deefaults to xhigh
--chat-template-file chat-template.jinja ^
--chat-template-kwargs "{\"preserve_thinking\": true, \"enable_thinking\": true}" ^
:: you ain't getting more than this
-np 1 ^
:: use the mmproj and banish it to CPU/RAM land to save vram (probably ~800-900 mb vram saving)
--mmproj mmproj-F16.gguf ^
--no-mmproj-offload ^
:: we need reasoning
--reasoning on ^
:: the image mmproj needs this line
--image-min-tokens 1024 ^
--metrics ^
--port 8080 ^
:: reduce vram spikes saving some vram
--batch-size 1024 ^
--ubatch-size 256 ^
:: allows more caching in RAM. According to Claude it's mostly for your context slot checkpoints that there is literally no room for
--cache-ram 24576 ^
--ctx-checkpoints 32 ^
:: Delta net architecture apparently has a bug where it just stalls forever saving and shifting contexts this is apparently supposed to help with this according to Cl*ude
--no-context-shift ^
:: force mtp header into the CPU/RAM (cl*ude estimates ~200 mb savings)
--override-tensor nextn=CPU ^
--jinja pauseWindows 환경에서 16GB VRAM으로 Qwen3.8 모델을 실행하기 위한 llama-server 명령줄 설정입니다.
언급된 도구
GGUF 모델을 로드하고 GPU 오프로딩, 캐시, 컨텍스트, 이미지 프로젝터 배치를 지정해 로컬 추론 서버를 실행합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.