본문으로 건너뛰기
r/LLMDevs조회 1

Qwen3.8 자체 호스팅에 필요한 GPU 구성

Qwen3.8-2.4T-A95B는 NVFP4에서도 8× B300급 GPU가 필요하며 TP 제약과 vLLM 설정이 실제 배포 규모를 결정합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Qwen3.8-2.4T-A95B는 전체 2.4T 파라미터와 토큰당 약 95B 활성 파라미터를 가진 Mixture of Experts 모델이지만, 추론을 위해 전체 가중치를 저장해야 해 자체 호스팅에 대규모 GPU 구성이 필요합니다. NVFP4는 약 1.32 TiB의 가중치와 약 1.74 TB의 실용적 배포 용량으로 8× B300 또는 약 16× H200을 요구하고, FP8은 약 2.27 TiB와 약 3.0 TB로 16× B300 또는 16× MI355X 규모가 필요합니다. 64개 Attention head 때문에 TP는 64를 나눌 수 있어야 하므로 TP12는 사용할 수 없으며, FP8 구성도 용량만 보면 가능한 12개 GB300 대신 TP16의 16개 GPU가 필요합니다. vLLM은 NVFP4에서 TP8, 최대 모델 길이 262,144, FP8 KV cache와 MTP speculative decoding 3개 토큰을 사용하며 사용자별 출력 속도 약 2.3배 향상을 보고했습니다.

실용적 조언

  • Qwen3.8-2.4T-A95B의 GPU 구성을 정할 때는 활성 파라미터 약 95B가 아니라 전체 2.4T 가중치 저장량을 먼저 계산해야 합니다. NVFP4는 약 1.74 TB 규모로 8× B300 또는 약 16× H200 구성을 기준으로 삼고, FP8은 약 3.0 TB 규모로 16× B300 또는 16× MI355X 이상을 고려해야 합니다. GPU 메모리 합계가 맞더라도 Tensor Parallelism 제약으로 구성이 달라질 수 있으므로 64개 Attention head를 나눌 수 있는 TP 값인지 함께 확인해야 합니다.
  • NVFP4 배포에서는 vLLM의 TP8 설정과 최대 모델 길이 262,144를 기준으로 검토할 수 있습니다. KV cache는 FP8로 설정하고 MTP speculative decoding에서 추측 토큰 3개를 적용하면 원문 레시피 기준 사용자별 출력 속도 약 2.3배 수치를 활용할 수 있습니다. BF16까지 필요하다면 배포 사다리의 24× B300 또는 24× MI355X 구성을 기준으로 다시 산정해야 합니다.

섹션별 상세

작성자는 Qwen3.8-2.4T-A95B를 자체 호스팅하려면 전체 2.4T 파라미터와 토큰당 활성화되는 약 95B 파라미터를 구분해야 한다고 정리했습니다. 모델은 512개 routed expert 중 10개와 shared expert를 사용하지만, 모든 가중치를 저장해야 하므로 실제 배포 규모는 활성 파라미터 수만으로 결정되지 않습니다. 이 구조 때문에 NVFP4 기준으로도 약 1.32 TiB의 가중치와 약 1.74 TB의 실용적 배포 용량이 필요합니다.
NVFP4는 NVIDIA 배포에서 가장 작은 GPU 구성을 만드는 경로로 제시됐습니다. 해당 형식은 약 8× B300 또는 약 16× H200 규모가 필요하고, FP8은 가중치 약 2.27 TiB와 약 3.0 TB의 배포 용량을 요구해 16× B300, 16× MI355X 또는 약 32× H200으로 늘어납니다. 따라서 양자화 형식은 모델 품질 설정뿐 아니라 필요한 GPU 수와 호스팅 비용을 직접 결정합니다.
GPU 수를 원시 메모리 용량만으로 계산하면 안 되는 이유는 Qwen3.8의 64개 Attention head에 있습니다. Tensor Parallelism 값은 64를 나눌 수 있어야 하므로 TP 1, 2, 4, 8, 16, 32는 가능하지만 TP12는 사용할 수 없습니다. FP8이 12개 GB300의 총 용량에 들어갈 것처럼 보여도 실제 설정에서는 TP16이 필요해 16개 GPU 구성이 됩니다.
NVFP4 vLLM 레시피는 TP8, 최대 모델 길이 262,144, FP8 KV cache를 사용합니다. 여기에 MTP speculative decoding과 추측 토큰 3개를 적용하며, 레시피 기준 사용자별 출력 속도가 약 2.3배 향상됩니다. 모델 가중치 배치뿐 아니라 병렬화와 디코딩 설정까지 함께 조정해야 실제 서비스 처리량을 확보할 수 있다는 의미입니다.

용어 해설

Mixture of Experts
전체 파라미터를 여러 전문가 네트워크로 나누고 토큰마다 일부 전문가만 활성화하는 구조입니다. Qwen3.8은 512개 routed expert 중 10개와 shared expert를 토큰별로 사용하지만, 추론을 위해 전체 가중치를 GPU 메모리 어딘가에 보관해야 합니다.
텐서 병렬화(Tensor Parallelism)
하나의 모델 텐서와 연산을 여러 GPU에 분할해 처리하는 방식입니다. 병렬화 수는 Attention head 수와 같은 모델 구조 조건을 만족해야 하므로, Qwen3.8에서는 64개 head를 나눌 수 있는 TP 값만 사용할 수 있습니다.
NVFP4 양자화(NVFP4)
NVIDIA GPU에서 모델 가중치를 낮은 비트 형식으로 저장해 메모리 요구량을 줄이는 수치 표현입니다. 원문 기준 Qwen3.8 체크포인트는 NVFP4에서 약 1.32 TiB이며, 실제 배포 규모는 약 1.74 TB로 계산됩니다.
FP8 KV Cache
Transformer의 Attention이 이미 처리한 Key와 Value를 저장하는 캐시를 FP8 형식으로 관리하는 방식입니다. Qwen3.8의 NVFP4 vLLM 설정은 262,144 최대 모델 길이와 FP8 KV cache를 함께 사용해 긴 문맥을 수용합니다.
추측 디코딩(Speculative Decoding)
큰 언어 모델이 다음 토큰을 모두 순차적으로 계산하는 대신, 별도 예측 경로가 후보 토큰을 미리 만들고 본 모델이 이를 검증하는 추론 방식입니다. 원문은 vLLM의 MTP 설정에서 추측 토큰 3개를 사용하며 사용자별 출력 속도가 약 2.3배 높아진다고 설명합니다.

언급된 도구

vLLM추천

Qwen3.8-2.4T-A95B를 GPU에 분할 배치하고 텍스트 생성을 서비스하는 추론 엔진입니다. 원문은 NVFP4에서 TP8, FP8 KV cache, 최대 모델 길이 262,144를 사용하는 레시피를 기준으로 삼았습니다. MTP speculative decoding과 추측 토큰 3개를 적용한 레시피에서 사용자별 출력 속도 약 2.3배 향상이 보고됐습니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 15.수집 2026. 08. 15.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.