본문으로 건너뛰기

AMD Strix와 3080 Ti에서 qwen3.8 긴 컨텍스트 성능 측정

AMD Strix와 3080 Ti를 나눠 쓴 qwen3.8의 최대 속도는 53tps였다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 128GB AMD Strix 머신과 Oculink로 연결한 12GB 3080 Ti에서 qwen3.8의 긴 컨텍스트 추론 속도를 측정했습니다. Q6·262K 설정은 MTP와 FastMTP 오프로딩으로 10tps에서 약 28tps까지 올랐고, Q4_K_M·262K 설정은 iGPU와 3080 Ti를 분산해 약 53tps를 기록했습니다. 1M 컨텍스트에서는 k-q8와 v-q4를 사용해 약 45tps를 얻었으며, 60~70GB의 여유 메모리로 qwen3 embedding과 qwen3 Reranker도 함께 적재할 수 있었습니다. 다만 5090보다 느리고, 4x3090에서 450tps로 구동되는 qwen3.6-35b와의 품질 비교가 남아 있습니다.

주요 논점

01찬성소수

AMD Strix와 3080 Ti를 조합한 하이브리드 구성이 qwen3.8의 긴 컨텍스트 추론에서 실용적인 처리량을 냈다는 입장입니다. Q4_K_M과 FastMTP 오프로딩으로 최대 약 53tps를 기록했고, 추가 모델을 적재할 메모리도 남았습니다.

02중립소수

작성자는 이 구성이 5090의 속도에는 미치지 못하며, qwen3.6-35b의 450tps와 비교해야 모델 품질과 성능을 제대로 판단할 수 있다고 봅니다. 현재 결과는 하드웨어 구성의 벤치마크이지 qwen3.8의 우수성을 확정한 결론은 아닙니다.

실용적 조언

  • 긴 컨텍스트에서 qwen3.8을 실행할 때 Q4_K_M과 FastMTP 오프로딩을 조합하면 작성자 환경에서 Q6보다 높은 처리량을 얻을 수 있습니다. 262K 컨텍스트에서는 약 53tps, 1M 컨텍스트에서는 약 45tps가 측정됐으므로 컨텍스트 길이와 양자화 형식을 함께 조정해야 합니다.
  • 외부 GPU의 VRAM만 보지 말고 시스템과 iGPU의 여유 메모리도 함께 확인할 필요가 있습니다. 작성자 환경에서는 60~70GB가 남아 qwen3 embedding과 qwen3 Reranker를 qwen3.8과 동시에 적재할 수 있었습니다.

섹션별 상세

작성자는 AMD 128GB Strix 머신과 Oculink로 연결한 12GB 3080 Ti eGPU에서 qwen3.8의 긴 컨텍스트 추론 속도를 측정했습니다. Q6, 262K 컨텍스트에서는 Strix 단독 실행이 10tps였지만 MTP n=4를 켜면 24tps, FastMTP를 3080에 오프로딩하면 약 28tps로 올라갔습니다. 같은 조건에서 MTP와 외부 GPU 분산이 토큰 생성 반복을 줄이고 보조 연산을 분담해 처리량을 높인 셈입니다.
Q4_K_M에서는 레이어 가중치 일부와 FastMTP를 3080에 배치하고 나머지를 iGPU에서 처리했을 때 262K 컨텍스트에서 약 53tps를 기록했습니다. 1M 컨텍스트에서는 k-q8, v-q4 설정을 사용하고 2GB 가중치와 FastMTP를 3080에 배치해 약 45tps를 얻었습니다. 컨텍스트 길이를 262K에서 1M으로 늘리면 KV 표현과 메모리 부담이 커져 속도가 낮아지지만, AMD 시스템에 60~70GB의 여유 메모리가 남아 qwen3 embedding과 qwen3 Reranker를 함께 적재할 수 있다는 점이 핵심입니다.
작성자는 이 구성이 5090보다 느리다는 한계를 인정하면서도, 여러 모델을 동시에 올릴 수 있는 메모리 여유를 장점으로 평가했습니다. 비교 대상으로는 4x3090에서 450tps로 실행 중인 qwen3.6-35b를 선택해 qwen3.8의 실제 모델 품질을 확인하려고 합니다. 따라서 이 글의 비교 기준은 단순 생성 속도뿐 아니라 긴 컨텍스트 처리와 embedding·Reranker를 함께 운용하는 구성의 효율까지 포함합니다.

용어 해설

다음 토큰 예측(MTP)
MTP는 언어 모델이 한 번에 여러 미래 토큰을 예측해 순차 디코딩의 반복 횟수를 줄이는 방식입니다. 이 글에서는 n=4 설정으로 생성 속도를 높이는 데 사용됩니다.
FastMTP
FastMTP는 MTP 처리를 별도 GPU에 분산해 메인 모델의 토큰 생성을 보조하는 방식입니다. 글에서는 3080 Ti로 일부 연산을 오프로딩해 초당 토큰 수를 높였습니다.
Oculink
Oculink는 외부 GPU를 시스템에 연결하는 고속 인터페이스입니다. 작성자는 AMD Strix 머신에 Oculink 기반 eGPU를 연결하고 12GB 3080 Ti를 함께 사용했습니다.
통합 GPU(iGPU)
iGPU는 CPU 또는 SoC에 통합된 그래픽 프로세서입니다. 이 글에서는 모델의 일부 레이어와 가중치를 iGPU에 배치하고 나머지 연산을 외부 3080 Ti와 나눴습니다.
Q4_K_M 양자화(Q4_K_M)
Q4_K_M은 모델 가중치를 낮은 비트 수로 저장해 메모리 사용량을 줄이는 양자화 형식입니다. 글에서는 262K와 1M 컨텍스트 설정에서 Q4_K_M을 사용해 더 높은 처리 속도를 얻었습니다.

언급된 도구

FastMTP추천

MTP 연산을 3080 Ti eGPU로 오프로딩해 qwen3.8의 토큰 생성 속도를 높이는 데 사용했습니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 18.수집 2026. 08. 19.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.