본문으로 건너뛰기

5070Ti에서 MTP를 뺀 85k 컨텍스트

5070Ti에서 MTP를 제거한 Qwen3.8-27B-Q3로 85k 컨텍스트와 40tok/s 생성을 구현한 설정

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 16GB VRAM을 탑재한 Nvidia 5070Ti에서 MTP layer를 제거한 Qwen3.8-27B-Q3를 실행해 최대 86.5k 수준의 긴 컨텍스트를 확보했습니다. gpu-layers=99, flash attention, q8_0 K·V cache와 speculative ngram 설정을 사용했고, 컨텍스트가 0일 때 약 1500tok/s의 prompt processing과 약 50tok/s의 token generation을 기록했습니다. 약 32k 컨텍스트에서는 속도가 각각 약 1200tok/s와 40tok/s로 낮아졌으며, q5 context는 더 긴 컨텍스트 대신 생성 속도 저하를 가져온다고 밝혔습니다. ubatch-size는 아직 최적화되지 않아 추가 ablation이 필요한 상태입니다.

실용적 조언

  • 긴 컨텍스트가 우선이라면 MTP layer 제거 여부를 먼저 비교해야 합니다. 이 글의 구성은 Python GGUF reader로 MTP를 제거한 모델을 만들고 85000~86.5k 컨텍스트를 사용하는 방식입니다. 다만 MTP 제거에 따른 생성 속도나 품질 변화는 별도 측정이 필요합니다.
  • q5 context는 더 큰 컨텍스트를 제공하지만 token generation 속도를 낮출 수 있습니다. 따라서 최대 컨텍스트 길이와 생성 속도 중 어느 쪽이 중요한지에 따라 cache 형식을 선택해야 합니다. 작성자는 현재 모델의 K·V cache에 q8_0을 사용하면서 약 32k 컨텍스트에서 40tok/s를 기록했습니다.
  • ubatch-size는 128로 설정됐지만 아직 ablation 대상입니다. 다른 값을 순차적으로 테스트하면서 prompt processing 속도와 token generation 속도, VRAM 사용량을 함께 기록해야 합니다. 현재 하드웨어에는 소량의 미사용 VRAM이 남아 있으므로 배치 관련 설정을 조정할 여지가 있습니다.

섹션별 상세

작성자는 Nvidia 5070Ti 16GB VRAM과 Ryzen 9 9900x, DDR5 32GB 5400 시스템에서 Qwen3.8-27B-Q3를 실행한 설정을 공유했습니다. 모델에는 gpu-layers=99와 flash-attn=on을 적용하고, 컨텍스트 크기를 85000으로 지정했으며, K·V cache에는 q8_0을 사용했습니다. 이 구성에서 컨텍스트가 0일 때 prompt processing은 약 1500tok/s, token generation은 약 50tok/s였고, 약 32k 컨텍스트에서는 각각 약 1200tok/s와 40tok/s로 측정됐습니다.
작성자의 핵심 선택은 더 긴 컨텍스트를 확보하기 위해 MTP layer를 제거한 것입니다. Python GGUF reader로 모델을 수정했으며, MTP를 포기하는 비용보다 컨텍스트 확장의 이점이 크다고 판단했습니다. 모델과 운영체제를 분리해 GPU에는 모델만 배치하고 운영체제는 iGPU에서 실행했으며, 아직 소량의 미사용 VRAM이 남아 있어 설정이 완전히 최적화된 상태는 아니라고 덧붙였습니다.
컨텍스트와 cache 설정은 생성 속도와 최대 입력 길이 사이의 절충으로 제시됐습니다. q5 context를 사용하면 더 큰 컨텍스트를 확보할 수 있지만 token generation 속도가 낮아지고, 현재 구성에서는 cache-type-k와 cache-type-v를 q8_0으로 설정했습니다. 또한 ubatch-size는 아직 ablation이 필요하다고 밝혀 128이라는 값이 최종 최적값으로 검증된 것은 아닙니다.

용어 해설

비디오 메모리(VRAM)
VRAM은 GPU가 모델 가중치와 추론 중 필요한 데이터를 저장하는 전용 메모리입니다. 이 글에서는 16GB VRAM을 모델에 집중 배치하고, 남는 공간을 활용해 더 긴 컨텍스트를 확보하려는 기준으로 쓰였습니다.
다중 토큰 예측(MTP)
MTP는 한 번에 여러 토큰을 예측하는 모델 구성 요소입니다. 작성자는 Python GGUF reader로 MTP layer를 제거해 모델의 일부 기능을 포기하는 대신, 더 큰 컨텍스트 크기와 추론 메모리 여유를 확보하는 선택을 했습니다.
GGUF 모델 파일 형식(GGUF)
GGUF는 양자화된 언어 모델 가중치와 실행에 필요한 메타데이터를 함께 저장하는 파일 형식입니다. 이 글에서는 Python GGUF reader를 사용해 모델 파일에서 MTP layer를 제거한 뒤 수정된 GGUF 파일을 추론에 사용했습니다.
컨텍스트 크기(context size)
컨텍스트 크기는 모델이 한 번의 대화 또는 요청에서 처리할 수 있는 토큰 범위입니다. 작성자는 기본 설정을 128000으로 두고 특정 모델 설정에서는 85000으로 제한했으며, 약 86.5k 컨텍스트를 실제로 실행한다고 밝혔습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 19.수집 2026. 08. 19.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.