본문으로 건너뛰기

Windows 16GB VRAM용 Qwen3.8 설정 공유

Windows 16GB VRAM에서 Qwen3.8을 구동하는 llama-server 설정과 메모리 절약 옵션을 공유한 글입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

게시자는 Windows의 16GB VRAM 환경에서 Qwen3.8-27B-Uncensored-IQ4-XS-MTP-16GB-VRAM-GGUF를 llama-server로 실행하는 구성을 공유합니다. MTP와 mmproj를 CPU와 RAM으로 보내고 Q4 K·Q4 V 캐시를 사용해 Windows가 차지하는 약 1.5GB의 VRAM 부담을 우회합니다. 컨텍스트는 100,100 토큰으로 지정하고 RAM 캐시 24,576과 컨텍스트 체크포인트 32개를 설정하지만, 100k를 넘으면 context rot이 생길 수 있다고 밝힙니다. 배치 크기와 마이크로 배치 크기를 낮춰 VRAM 급증을 줄이고, `--no-context-shift`로 컨텍스트 이동에 따른 정지 문제를 피하려는 구성이 핵심입니다.

실용적 조언

  • Windows에서 16GB VRAM으로 해당 GGUF를 실행할 때는 `--cache-type-k q4_0`과 `--cache-type-v q4_0`를 사용하고, mmproj와 MTP 관련 텐서를 CPU와 RAM으로 보내는 구성을 우선 적용할 수 있습니다.
  • 긴 컨텍스트를 지정하더라도 약 100k 이상에서는 context rot이 발생할 수 있으므로 `-c 100100`처럼 실제 하드웨어에서 적합성을 확인한 뒤 상한을 정하는 방식이 필요합니다.

섹션별 상세

01
게시자는 Windows에서 Qwen3.8-27B-Uncensored-IQ4-XS-MTP-16GB-VRAM-GGUF를 실행하면서 MTP를 끄고 Q4 K와 Q4 V 캐시를 사용합니다. Windows가 약 1.5GB의 VRAM을 차지하므로 GPU에는 14.5GB보다 적은 공간만 남는다는 제약이 설정의 출발점입니다. Linux나 iGPU 환경에서는 이 제약이 줄어들어 같은 모델을 더 여유롭게 배치할 수 있다고 적습니다.
02
모든 모델 레이어를 GPU에 오프로딩하되 mmproj는 `--no-mmproj-offload`로 CPU와 RAM에 남겨 VRAM을 절약합니다. 게시자는 이 방식으로 약 800~900MB의 VRAM을 아낄 수 있다고 추정하고, 이미지 입력을 위해 `--image-min-tokens 1024`를 별도로 지정합니다. MTP 헤더도 `--override-tensor nextn=CPU`로 CPU와 RAM에 배치해 추가로 약 200MB를 확보하려고 합니다.
03
컨텍스트 길이는 `-c 100100`으로 설정하고 `--cache-ram 24576`, `--ctx-checkpoints 32`를 사용해 긴 대화 상태를 RAM에 저장하려고 합니다. 동시에 100k를 넘는 구간에서는 context rot이 발생할 수 있다고 경고하며, `--no-context-shift`로 컨텍스트 이동을 막습니다. 배치 크기는 1024, 마이크로 배치 크기는 256으로 제한해 VRAM 급증을 줄이는 구성이며, 게시자는 Delta net architecture의 정지 문제와 관련해 이 옵션을 사용한다고 적습니다.

용어 해설

다음 토큰 예측(MTP)
MTP는 모델이 현재 토큰 다음의 토큰을 한 개만 예측하지 않고 여러 미래 토큰까지 함께 예측하는 처리 방식입니다. 이 게시물에서는 VRAM을 아끼기 위해 MTP 기능을 끈 상태로 모델을 실행합니다.
GGUF 모델 형식(GGUF)
GGUF는 양자화된 LLM 가중치와 실행에 필요한 메타데이터를 하나의 파일에 저장하는 형식입니다. 게시물에서는 Q4 계열로 줄인 Qwen 모델을 GGUF 파일로 llama-server에 입력합니다.
멀티모달 프로젝터(mmproj)
mmproj는 이미지 입력을 언어 모델이 처리할 수 있는 표현으로 변환하는 구성 요소입니다. 게시물에서는 mmproj를 GPU 대신 CPU와 RAM에 배치해 약 800~900MB의 VRAM을 절약하려고 합니다.
컨텍스트 윈도(Context Window)
컨텍스트 윈도는 모델이 한 번에 유지하고 처리하는 입력 토큰 범위입니다. 게시물의 설정은 약 100,100 토큰을 지정하지만, 100k를 넘기면 context rot이 나타날 수 있다고 적습니다.
컨텍스트 체크포인트(Context Checkpoints)
컨텍스트 체크포인트는 긴 대화의 상태를 저장해 이후 처리에서 재사용하는 실행 설정입니다. 게시물은 RAM에 캐시 공간을 확보하고 32개의 체크포인트를 지정해 컨텍스트 슬롯 상태를 보존하려고 합니다.

코드 예제

batch
.\ikllama\llama-server.exe ^
-m "D:\AI models\qwen3.8\Qwen3.8-27B-Uncensored-IQ4-XS-MTP-16GB-VRAM-GGUF.gguf" ^
:: gpu offload all layers (99 is more than the max)
-ngl 99 ^
:: this depends on your cpu
-t 8 ^
:: literally can't fit in anything at higher q to save vram
--cache-type-k q4_0 ^
--cache-type-v q4_0 ^
:: check your max context size with fit, at around >100k context rot sets in
-c 100100 ^
:: this flag should always be on to optimise speed and memory use
-fa on ^
:: You need a fixed jinja file to prevent it rambling forever, I believe this deefaults to xhigh
--chat-template-file chat-template.jinja ^
--chat-template-kwargs "{\"preserve_thinking\": true, \"enable_thinking\": true}" ^
:: you ain't getting more than this
-np 1 ^
:: use the mmproj and banish it to CPU/RAM land to save vram (probably ~800-900 mb vram saving)
--mmproj mmproj-F16.gguf ^
--no-mmproj-offload ^
:: we need reasoning
--reasoning on ^
:: the image mmproj needs this line
--image-min-tokens 1024 ^
--metrics ^
--port 8080 ^
:: reduce vram spikes saving some vram
--batch-size 1024 ^
--ubatch-size 256 ^
:: allows more caching in RAM. According to Claude it's mostly for your context slot checkpoints that there is literally no room for
--cache-ram 24576 ^
--ctx-checkpoints 32 ^
:: Delta net architecture apparently has a bug where it just stalls forever saving and shifting contexts this is apparently supposed to help with this according to Cl*ude
--no-context-shift ^
:: force mtp header into the CPU/RAM (cl*ude estimates ~200 mb savings)
--override-tensor nextn=CPU ^
--jinja pause

Windows 환경에서 16GB VRAM으로 Qwen3.8 모델을 실행하기 위한 llama-server 명령줄 설정입니다.

언급된 도구

llama-server중립

GGUF 모델을 로드하고 GPU 오프로딩, 캐시, 컨텍스트, 이미지 프로젝터 배치를 지정해 로컬 추론 서버를 실행합니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 22.수집 2026. 08. 22.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.