TL;DR
작성자는 128GB AMD Strix 머신과 Oculink로 연결한 12GB 3080 Ti에서 qwen3.8의 긴 컨텍스트 추론 속도를 측정했습니다. Q6·262K 설정은 MTP와 FastMTP 오프로딩으로 10tps에서 약 28tps까지 올랐고, Q4_K_M·262K 설정은 iGPU와 3080 Ti를 분산해 약 53tps를 기록했습니다. 1M 컨텍스트에서는 k-q8와 v-q4를 사용해 약 45tps를 얻었으며, 60~70GB의 여유 메모리로 qwen3 embedding과 qwen3 Reranker도 함께 적재할 수 있었습니다. 다만 5090보다 느리고, 4x3090에서 450tps로 구동되는 qwen3.6-35b와의 품질 비교가 남아 있습니다.
주요 논점
AMD Strix와 3080 Ti를 조합한 하이브리드 구성이 qwen3.8의 긴 컨텍스트 추론에서 실용적인 처리량을 냈다는 입장입니다. Q4_K_M과 FastMTP 오프로딩으로 최대 약 53tps를 기록했고, 추가 모델을 적재할 메모리도 남았습니다.
작성자는 이 구성이 5090의 속도에는 미치지 못하며, qwen3.6-35b의 450tps와 비교해야 모델 품질과 성능을 제대로 판단할 수 있다고 봅니다. 현재 결과는 하드웨어 구성의 벤치마크이지 qwen3.8의 우수성을 확정한 결론은 아닙니다.
실용적 조언
- 긴 컨텍스트에서 qwen3.8을 실행할 때 Q4_K_M과 FastMTP 오프로딩을 조합하면 작성자 환경에서 Q6보다 높은 처리량을 얻을 수 있습니다. 262K 컨텍스트에서는 약 53tps, 1M 컨텍스트에서는 약 45tps가 측정됐으므로 컨텍스트 길이와 양자화 형식을 함께 조정해야 합니다.
- 외부 GPU의 VRAM만 보지 말고 시스템과 iGPU의 여유 메모리도 함께 확인할 필요가 있습니다. 작성자 환경에서는 60~70GB가 남아 qwen3 embedding과 qwen3 Reranker를 qwen3.8과 동시에 적재할 수 있었습니다.
섹션별 상세
용어 해설
- 다음 토큰 예측(MTP)
- — MTP는 언어 모델이 한 번에 여러 미래 토큰을 예측해 순차 디코딩의 반복 횟수를 줄이는 방식입니다. 이 글에서는 n=4 설정으로 생성 속도를 높이는 데 사용됩니다.
- FastMTP
- — FastMTP는 MTP 처리를 별도 GPU에 분산해 메인 모델의 토큰 생성을 보조하는 방식입니다. 글에서는 3080 Ti로 일부 연산을 오프로딩해 초당 토큰 수를 높였습니다.
- Oculink
- — Oculink는 외부 GPU를 시스템에 연결하는 고속 인터페이스입니다. 작성자는 AMD Strix 머신에 Oculink 기반 eGPU를 연결하고 12GB 3080 Ti를 함께 사용했습니다.
- 통합 GPU(iGPU)
- — iGPU는 CPU 또는 SoC에 통합된 그래픽 프로세서입니다. 이 글에서는 모델의 일부 레이어와 가중치를 iGPU에 배치하고 나머지 연산을 외부 3080 Ti와 나눴습니다.
- Q4_K_M 양자화(Q4_K_M)
- — Q4_K_M은 모델 가중치를 낮은 비트 수로 저장해 메모리 사용량을 줄이는 양자화 형식입니다. 글에서는 262K와 1M 컨텍스트 설정에서 Q4_K_M을 사용해 더 높은 처리 속도를 얻었습니다.
언급된 도구
MTP 연산을 3080 Ti eGPU로 오프로딩해 qwen3.8의 토큰 생성 속도를 높이는 데 사용했습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.