TL;DR
작성자는 16GB VRAM을 탑재한 Nvidia 5070Ti에서 MTP layer를 제거한 Qwen3.8-27B-Q3를 실행해 최대 86.5k 수준의 긴 컨텍스트를 확보했습니다. gpu-layers=99, flash attention, q8_0 K·V cache와 speculative ngram 설정을 사용했고, 컨텍스트가 0일 때 약 1500tok/s의 prompt processing과 약 50tok/s의 token generation을 기록했습니다. 약 32k 컨텍스트에서는 속도가 각각 약 1200tok/s와 40tok/s로 낮아졌으며, q5 context는 더 긴 컨텍스트 대신 생성 속도 저하를 가져온다고 밝혔습니다. ubatch-size는 아직 최적화되지 않아 추가 ablation이 필요한 상태입니다.
실용적 조언
- 긴 컨텍스트가 우선이라면 MTP layer 제거 여부를 먼저 비교해야 합니다. 이 글의 구성은 Python GGUF reader로 MTP를 제거한 모델을 만들고 85000~86.5k 컨텍스트를 사용하는 방식입니다. 다만 MTP 제거에 따른 생성 속도나 품질 변화는 별도 측정이 필요합니다.
- q5 context는 더 큰 컨텍스트를 제공하지만 token generation 속도를 낮출 수 있습니다. 따라서 최대 컨텍스트 길이와 생성 속도 중 어느 쪽이 중요한지에 따라 cache 형식을 선택해야 합니다. 작성자는 현재 모델의 K·V cache에 q8_0을 사용하면서 약 32k 컨텍스트에서 40tok/s를 기록했습니다.
- ubatch-size는 128로 설정됐지만 아직 ablation 대상입니다. 다른 값을 순차적으로 테스트하면서 prompt processing 속도와 token generation 속도, VRAM 사용량을 함께 기록해야 합니다. 현재 하드웨어에는 소량의 미사용 VRAM이 남아 있으므로 배치 관련 설정을 조정할 여지가 있습니다.
섹션별 상세
용어 해설
- 비디오 메모리(VRAM)
- — VRAM은 GPU가 모델 가중치와 추론 중 필요한 데이터를 저장하는 전용 메모리입니다. 이 글에서는 16GB VRAM을 모델에 집중 배치하고, 남는 공간을 활용해 더 긴 컨텍스트를 확보하려는 기준으로 쓰였습니다.
- 다중 토큰 예측(MTP)
- — MTP는 한 번에 여러 토큰을 예측하는 모델 구성 요소입니다. 작성자는 Python GGUF reader로 MTP layer를 제거해 모델의 일부 기능을 포기하는 대신, 더 큰 컨텍스트 크기와 추론 메모리 여유를 확보하는 선택을 했습니다.
- GGUF 모델 파일 형식(GGUF)
- — GGUF는 양자화된 언어 모델 가중치와 실행에 필요한 메타데이터를 함께 저장하는 파일 형식입니다. 이 글에서는 Python GGUF reader를 사용해 모델 파일에서 MTP layer를 제거한 뒤 수정된 GGUF 파일을 추론에 사용했습니다.
- 컨텍스트 크기(context size)
- — 컨텍스트 크기는 모델이 한 번의 대화 또는 요청에서 처리할 수 있는 토큰 범위입니다. 작성자는 기본 설정을 128000으로 두고 특정 모델 설정에서는 85000으로 제한했으며, 약 86.5k 컨텍스트를 실제로 실행한다고 밝혔습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.