TL;DR
Qwen3.8-2.4T-A95B는 전체 2.4T 파라미터와 토큰당 약 95B 활성 파라미터를 가진 Mixture of Experts 모델이지만, 추론을 위해 전체 가중치를 저장해야 해 자체 호스팅에 대규모 GPU 구성이 필요합니다. NVFP4는 약 1.32 TiB의 가중치와 약 1.74 TB의 실용적 배포 용량으로 8× B300 또는 약 16× H200을 요구하고, FP8은 약 2.27 TiB와 약 3.0 TB로 16× B300 또는 16× MI355X 규모가 필요합니다. 64개 Attention head 때문에 TP는 64를 나눌 수 있어야 하므로 TP12는 사용할 수 없으며, FP8 구성도 용량만 보면 가능한 12개 GB300 대신 TP16의 16개 GPU가 필요합니다. vLLM은 NVFP4에서 TP8, 최대 모델 길이 262,144, FP8 KV cache와 MTP speculative decoding 3개 토큰을 사용하며 사용자별 출력 속도 약 2.3배 향상을 보고했습니다.
실용적 조언
- Qwen3.8-2.4T-A95B의 GPU 구성을 정할 때는 활성 파라미터 약 95B가 아니라 전체 2.4T 가중치 저장량을 먼저 계산해야 합니다. NVFP4는 약 1.74 TB 규모로 8× B300 또는 약 16× H200 구성을 기준으로 삼고, FP8은 약 3.0 TB 규모로 16× B300 또는 16× MI355X 이상을 고려해야 합니다. GPU 메모리 합계가 맞더라도 Tensor Parallelism 제약으로 구성이 달라질 수 있으므로 64개 Attention head를 나눌 수 있는 TP 값인지 함께 확인해야 합니다.
- NVFP4 배포에서는 vLLM의 TP8 설정과 최대 모델 길이 262,144를 기준으로 검토할 수 있습니다. KV cache는 FP8로 설정하고 MTP speculative decoding에서 추측 토큰 3개를 적용하면 원문 레시피 기준 사용자별 출력 속도 약 2.3배 수치를 활용할 수 있습니다. BF16까지 필요하다면 배포 사다리의 24× B300 또는 24× MI355X 구성을 기준으로 다시 산정해야 합니다.
섹션별 상세
용어 해설
- Mixture of Experts
- — 전체 파라미터를 여러 전문가 네트워크로 나누고 토큰마다 일부 전문가만 활성화하는 구조입니다. Qwen3.8은 512개 routed expert 중 10개와 shared expert를 토큰별로 사용하지만, 추론을 위해 전체 가중치를 GPU 메모리 어딘가에 보관해야 합니다.
- 텐서 병렬화(Tensor Parallelism)
- — 하나의 모델 텐서와 연산을 여러 GPU에 분할해 처리하는 방식입니다. 병렬화 수는 Attention head 수와 같은 모델 구조 조건을 만족해야 하므로, Qwen3.8에서는 64개 head를 나눌 수 있는 TP 값만 사용할 수 있습니다.
- NVFP4 양자화(NVFP4)
- — NVIDIA GPU에서 모델 가중치를 낮은 비트 형식으로 저장해 메모리 요구량을 줄이는 수치 표현입니다. 원문 기준 Qwen3.8 체크포인트는 NVFP4에서 약 1.32 TiB이며, 실제 배포 규모는 약 1.74 TB로 계산됩니다.
- FP8 KV Cache
- — Transformer의 Attention이 이미 처리한 Key와 Value를 저장하는 캐시를 FP8 형식으로 관리하는 방식입니다. Qwen3.8의 NVFP4 vLLM 설정은 262,144 최대 모델 길이와 FP8 KV cache를 함께 사용해 긴 문맥을 수용합니다.
- 추측 디코딩(Speculative Decoding)
- — 큰 언어 모델이 다음 토큰을 모두 순차적으로 계산하는 대신, 별도 예측 경로가 후보 토큰을 미리 만들고 본 모델이 이를 검증하는 추론 방식입니다. 원문은 vLLM의 MTP 설정에서 추측 토큰 3개를 사용하며 사용자별 출력 속도가 약 2.3배 높아진다고 설명합니다.
언급된 도구
Qwen3.8-2.4T-A95B를 GPU에 분할 배치하고 텍스트 생성을 서비스하는 추론 엔진입니다. 원문은 NVFP4에서 TP8, FP8 KV cache, 최대 모델 길이 262,144를 사용하는 레시피를 기준으로 삼았습니다. MTP speculative decoding과 추측 토큰 3개를 적용한 레시피에서 사용자별 출력 속도 약 2.3배 향상이 보고됐습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.