본문으로 건너뛰기

Qwen3.8-2.4T-A95B 초대형 오픈 모델의 GB300 서빙

Qwen3.8-2.4T-A95B가 선택적 Expert 활성화와 Hybrid Attention으로 GB300 NVL72에서 초대형 모델 서빙을 구현합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Alibaba의 Qwen3.8-2.4T-A95B는 총 2.4T 파라미터와 토큰당 95B 활성화를 결합한 오픈 웨이트 MoE 모델로, 코딩과 대규모 문서 분석 같은 Agentic workload를 겨냥합니다. Full Attention과 Linear Attention을 교대로 사용해 긴 문맥에서 KV cache 증가를 제한하고, Router가 토큰마다 필요한 Expert만 선택해 전체 모델을 매번 계산하지 않습니다. NVIDIA GB300 NVL72의 72개 Blackwell Ultra GPU와 130 TB/s NVLink 영역에서 FP8로 추가 모델 Tuning 없이 GPU당 초당 4K 토큰 초과, 사용자당 초당 350토큰 초과를 기록했습니다. 개발자는 SGLang, vLLM, NVIDIA Dynamo, NVIDIA NIM으로 서빙하고 NVIDIA NeMo AutoModel을 통해 SFT 또는 LoRA Fine-tuning으로 도메인별 Checkpoint를 만들 수 있습니다.

빠른 이해

새로운 점

2.4T 전체 파라미터와 토큰당 95B 활성화를 결합한 오픈 웨이트 모델을 72-GPU GB300 NVL72에서 추가 Tuning 없이 서빙하는 경로를 제시합니다.

핵심 메커니즘

입력 문맥은 Full Attention과 Linear Attention을 교대로 통과하고, 토큰별 Router는 필요한 소수의 Expert만 활성화합니다. GB300 NVL72의 72-GPU NVIDIA NVLink 영역이 Expert 간 통신을 처리하며, FP8 기반 추론 Runtime이 출력 토큰을 생성합니다.

핵심 수치

  • 전체 파라미터: 2.4T- Qwen3.8-2.4T-A95B 총 파라미터
  • 토큰당 활성 파라미터: 95B- Fine-grained MoE에서 Router가 활성화하는 규모
  • 최대 문맥 길이: 최대 100만 토큰- Full Attention과 Linear Attention Hybrid Architecture
  • 최대 출력 길이: 최대 128K- 기사에 제시된 출력 길이
  • GPU당 처리량: 초당 4K 토큰 초과- NVIDIA GB300 NVL72, FP8, 추가 모델 Tuning 없음
  • 사용자당 처리량: 초당 350토큰 초과- NVIDIA GB300 NVL72의 Day-0 성능

섹션별 상세

초대형 오픈 웨이트 모델의 서빙 과제

Alibaba가 공개한 Qwen3.8-2.4T-A95B는 총 2.4T 파라미터와 토큰당 95B 활성 파라미터를 갖춘 Qwen3.8-Max 계열의 오픈 웨이트 모델입니다. 이 모델은 코딩, 대규모 문서 분석, 장시간의 다단계 작업처럼 시스템 지침, 도구 출력, 검색 문서, 코드, 로그, 추론 기록이 계속 쌓이는 Agentic workload를 목표로 합니다. 2.4T 파라미터를 데이터센터 규모의 가속 컴퓨팅으로 처리해야 하므로 칩, 시스템 아키텍처, 추론 소프트웨어를 함께 최적화하는 구성이 필요합니다. NVIDIA는 최적화 Kernel, 추론 Runtime, 분산 서빙 Recipe를 통해 Multinode 배포 경로를 마련했습니다.
근거
  • Qwen3.8-2.4T-A95B는 총 2.4T 파라미터 중 토큰당 95B를 활성화하는 Fine-grained MoE 모델이다. 기사 도입부의 모델 규모 설명과 Fine-grained MoE 구조 설명

긴 문맥을 제한된 비용으로 처리하는 구조

Agentic workflow에서는 문맥이 길어질수록 Attention 계산량과 KV cache 메모리가 함께 증가해 처리량을 제한합니다. Qwen3.8-2.4T-A95B는 모든 토큰이 서로를 참조하는 Full Attention과, 증가하는 KV cache를 제한된 Recurrent State로 대체하는 Linear Attention을 교대로 배치합니다. 이 Hybrid Architecture는 문맥이 최대 100만 토큰까지 늘어날 때 계산과 메모리 사용량을 제한된 범위에 유지하도록 설계됐으며, 출력 길이는 최대 128K입니다. Fine-grained MoE에서는 많은 수의 작은 Expert에 모델 용량을 나누고 학습된 Router가 토큰마다 필요한 Expert만 활성화해 서빙 비용이 전체 2.4T가 아니라 활성 파라미터 규모를 따라가게 합니다.
Qwen3.8-2.4T-A95B가 긴 문맥과 초대형 파라미터를 처리하는 방식을 문제, 구조, 결과의 흐름으로 나타낸 다이어그램입니다.
Diagram이미지는 984K 토큰의 문서·코드·도구 출력을 Full Attention과 Linear Attention의 Hybrid Architecture로 처리해 메모리 사용량을 줄이는 흐름을 나타냅니다. 아래 구조에서는 2.4T 파라미터 전체를 모든 토큰에 계산하지 않고 Mixture of Experts가 필요한 Expert만 깨워 토큰당 활성 파라미터를 일부로 제한합니다. 본문이 설명한 긴 문맥의 KV cache 부담과 토큰별 Expert Routing을 시각적으로 연결합니다.
근거
  • Full Attention과 Linear Attention의 Hybrid Architecture는 최대 100만 토큰 문맥에서 계산과 메모리 사용량을 제한된 범위에 유지하도록 설계됐다. Architectural innovations for long-context inference 절과 Figure 1 설명
  • 내장 Reasoning control은 low, high, xhigh 설정으로 요청별 추론 깊이와 연산량을 조절한다. Built-in reasoning controls 절의 low/high/xhigh 설명

GB300 NVL72의 초기 추론 성능

NVIDIA는 Qwen3.8-2.4T-A95B를 추가 모델 Tuning 없이 GB300 NVL72에서 FP8로 실행해 초기 서빙 성능을 측정했습니다. GB300 NVL72는 NVIDIA Blackwell Ultra GPU 72개를 하나의 플랫폼에 통합하고, 130 TB/s의 NVIDIA NVLink 통신 영역으로 Expert 간 all-to-all 데이터 교환을 처리합니다. 공식 수치에서 GPU당 처리량은 초당 4K 토큰을 넘었고 사용자당 처리량은 초당 350토큰을 넘었으며, 제공된 성능 곡선은 사용자 수가 늘어날수록 사용자당 상호작용성이 낮아지는 교환 관계를 나타냅니다. NVIDIA는 이후 NVFP4 Precision 최적화가 추가 성능 향상을 가져올 것으로 예상하고 있습니다.
NVIDIA GB300 NVL72에서 Qwen3.8-2.4T-A95B의 GPU당 처리량과 사용자당 상호작용성 관계를 나타낸 성능 곡선입니다.
Chart그래프의 세로축은 GPU당 처리량을 초당 토큰으로, 가로축은 사용자당 상호작용성을 초당 토큰으로 나타내며 두 지표 사이의 Pareto 곡선을 제시합니다. 곡선은 낮은 동시 사용자 구간에서 GPU당 처리량이 4,000 TPS를 넘는 지점에서 시작한 뒤 사용자당 처리량이 증가할수록 GPU당 처리량이 감소하는 형태입니다. 본문에 제시된 FP8, TensorRT-LLM, ISL/OSL 8k/1k 조건의 Day-0 서빙 수치를 해석하는 근거가 됩니다.
근거
  • GB300 NVL72에서 FP8로 실행한 Qwen3.8-2.4T-A95B는 GPU당 초당 4K 토큰 이상, 사용자당 초당 350토큰 이상의 처리량을 기록했다. Qwen3.8-2.4T-A95B optimized performance on GB300 NVL72 절과 Figure 2 설명
  • GB300 NVL72는 72개 NVIDIA Blackwell Ultra GPU를 130 TB/s NVIDIA NVLink 영역으로 연결한다. GB300 NVL72 하드웨어 구성과 all-to-all 통신 설명

추론과 Fine-tuning 배포 경로

개발자는 SGLang, vLLM, NVIDIA Dynamo를 사용해 NVIDIA 가속 플랫폼의 성능을 직접 조정하는 오픈소스 추론 Recipe를 선택할 수 있습니다. 모델을 특정하지 않는 NVIDIA NIM은 지원 모델을 하나의 추론 Container로 서빙하며, Hugging Face 또는 ModelScope에서 받은 Weight를 Day 0부터 배포할 수 있게 합니다. 도메인별 활용을 위해 NVIDIA NeMo AutoModel은 PyTorch 기반 Fine-tuning Library로 기존 Checkpoint를 변환하지 않고 학습하며, 전체 SFT와 메모리 효율적인 LoRA Fine-tuning을 모두 지원합니다. 따라서 동일한 모델 Weight를 직접 서빙하거나 후처리 학습한 Checkpoint로 확장하는 두 경로가 제공됩니다.

용어 해설

Mixture of Experts
여러 개의 작은 Expert 중 입력 토큰마다 필요한 일부만 선택해 처리하는 모델 구조입니다. 학습된 Router가 토큰을 Expert에 배정하므로 전체 파라미터를 매번 계산하지 않고도 큰 모델 용량을 활용할 수 있습니다. Qwen3.8-2.4T-A95B에서는 2.4T 전체 파라미터 중 토큰당 95B만 활성화됩니다.
Linear Attention
토큰 수가 늘어날 때 모든 토큰 간 관계를 직접 저장하는 대신 제한된 Recurrent State로 정보를 압축하는 Attention 방식입니다. 이에 따라 긴 문맥에서 커지는 KV cache 부담을 줄이고 계산량과 메모리 사용량을 제한된 범위에 유지합니다. Qwen3.8-2.4T-A95B는 Full Attention과 번갈아 사용해 최대 100만 토큰 문맥을 처리하도록 설계됐습니다.
KV Cache
생성 과정에서 이전 토큰의 Key와 Value를 저장해 같은 문맥을 반복 계산하지 않도록 하는 메모리 구조입니다. 문맥이 길어질수록 저장해야 할 정보가 증가해 긴 대화, 검색 문서, 도구 출력이 누적되는 Agentic workflow에서 병목이 됩니다. 이 모델은 Linear Attention 구간에서 KV cache 대신 제한된 Recurrent State를 사용합니다.
FP8 정밀도(FP8 Precision)
8비트 부동소수점 형식으로 모델 추론을 수행하는 방식입니다. FP8은 낮은 수치 정밀도를 사용해 메모리와 연산 부담을 줄이는 대신, 모델 품질과 수치 안정성을 함께 고려해야 합니다. NVIDIA GB300 NVL72에서 Qwen3.8-2.4T-A95B의 초기 성능 수치는 FP8 조건으로 측정됐습니다.
NVIDIA NVLink Domain
여러 GPU를 고속 연결해 GPU 사이의 데이터 교환을 단일 통신 영역처럼 처리하는 시스템 구성입니다. GB300 NVL72는 72개 NVIDIA Blackwell Ultra GPU를 130 TB/s 대역폭의 NVIDIA NVLink 영역으로 연결해 MoE Expert 간 all-to-all 통신 병목을 줄입니다. 대규모 모델 서빙에서는 Expert 요청이 전통적인 네트워크를 통과하는 횟수와 비용을 낮추는 역할을 합니다.

기술

  • Qwen3.8-2.4T-A95B
  • Qwen3.8-Max
  • Mixture of Experts (MoE)
  • Full Attention
  • Linear Attention
  • KV cache
  • NVIDIA GB300 NVL72
  • NVIDIA Blackwell Ultra
  • NVIDIA NVLink
  • TensorRT-LLM
  • FP8
  • NVFP4
  • SGLang
  • vLLM
  • NVIDIA Dynamo
  • NVIDIA NIM
  • NVIDIA NeMo AutoModel
  • PyTorch
  • SFT
  • LoRA
  • Hugging Face
  • ModelScope

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 08. 13.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.