TL;DR
Alibaba의 Qwen3.8-2.4T-A95B는 총 2.4T 파라미터와 토큰당 95B 활성화를 결합한 오픈 웨이트 MoE 모델로, 코딩과 대규모 문서 분석 같은 Agentic workload를 겨냥합니다. Full Attention과 Linear Attention을 교대로 사용해 긴 문맥에서 KV cache 증가를 제한하고, Router가 토큰마다 필요한 Expert만 선택해 전체 모델을 매번 계산하지 않습니다. NVIDIA GB300 NVL72의 72개 Blackwell Ultra GPU와 130 TB/s NVLink 영역에서 FP8로 추가 모델 Tuning 없이 GPU당 초당 4K 토큰 초과, 사용자당 초당 350토큰 초과를 기록했습니다. 개발자는 SGLang, vLLM, NVIDIA Dynamo, NVIDIA NIM으로 서빙하고 NVIDIA NeMo AutoModel을 통해 SFT 또는 LoRA Fine-tuning으로 도메인별 Checkpoint를 만들 수 있습니다.
빠른 이해
새로운 점
2.4T 전체 파라미터와 토큰당 95B 활성화를 결합한 오픈 웨이트 모델을 72-GPU GB300 NVL72에서 추가 Tuning 없이 서빙하는 경로를 제시합니다.
핵심 메커니즘
입력 문맥은 Full Attention과 Linear Attention을 교대로 통과하고, 토큰별 Router는 필요한 소수의 Expert만 활성화합니다. GB300 NVL72의 72-GPU NVIDIA NVLink 영역이 Expert 간 통신을 처리하며, FP8 기반 추론 Runtime이 출력 토큰을 생성합니다.
핵심 수치
- 전체 파라미터: 2.4T- Qwen3.8-2.4T-A95B 총 파라미터
- 토큰당 활성 파라미터: 95B- Fine-grained MoE에서 Router가 활성화하는 규모
- 최대 문맥 길이: 최대 100만 토큰- Full Attention과 Linear Attention Hybrid Architecture
- 최대 출력 길이: 최대 128K- 기사에 제시된 출력 길이
- GPU당 처리량: 초당 4K 토큰 초과- NVIDIA GB300 NVL72, FP8, 추가 모델 Tuning 없음
- 사용자당 처리량: 초당 350토큰 초과- NVIDIA GB300 NVL72의 Day-0 성능
섹션별 상세
초대형 오픈 웨이트 모델의 서빙 과제
- Qwen3.8-2.4T-A95B는 총 2.4T 파라미터 중 토큰당 95B를 활성화하는 Fine-grained MoE 모델이다. — 기사 도입부의 모델 규모 설명과 Fine-grained MoE 구조 설명
긴 문맥을 제한된 비용으로 처리하는 구조

- Full Attention과 Linear Attention의 Hybrid Architecture는 최대 100만 토큰 문맥에서 계산과 메모리 사용량을 제한된 범위에 유지하도록 설계됐다. — Architectural innovations for long-context inference 절과 Figure 1 설명
- 내장 Reasoning control은 low, high, xhigh 설정으로 요청별 추론 깊이와 연산량을 조절한다. — Built-in reasoning controls 절의 low/high/xhigh 설명
GB300 NVL72의 초기 추론 성능

- GB300 NVL72에서 FP8로 실행한 Qwen3.8-2.4T-A95B는 GPU당 초당 4K 토큰 이상, 사용자당 초당 350토큰 이상의 처리량을 기록했다. — Qwen3.8-2.4T-A95B optimized performance on GB300 NVL72 절과 Figure 2 설명
- GB300 NVL72는 72개 NVIDIA Blackwell Ultra GPU를 130 TB/s NVIDIA NVLink 영역으로 연결한다. — GB300 NVL72 하드웨어 구성과 all-to-all 통신 설명
추론과 Fine-tuning 배포 경로
용어 해설
- Mixture of Experts
- — 여러 개의 작은 Expert 중 입력 토큰마다 필요한 일부만 선택해 처리하는 모델 구조입니다. 학습된 Router가 토큰을 Expert에 배정하므로 전체 파라미터를 매번 계산하지 않고도 큰 모델 용량을 활용할 수 있습니다. Qwen3.8-2.4T-A95B에서는 2.4T 전체 파라미터 중 토큰당 95B만 활성화됩니다.
- Linear Attention
- — 토큰 수가 늘어날 때 모든 토큰 간 관계를 직접 저장하는 대신 제한된 Recurrent State로 정보를 압축하는 Attention 방식입니다. 이에 따라 긴 문맥에서 커지는 KV cache 부담을 줄이고 계산량과 메모리 사용량을 제한된 범위에 유지합니다. Qwen3.8-2.4T-A95B는 Full Attention과 번갈아 사용해 최대 100만 토큰 문맥을 처리하도록 설계됐습니다.
- KV Cache
- — 생성 과정에서 이전 토큰의 Key와 Value를 저장해 같은 문맥을 반복 계산하지 않도록 하는 메모리 구조입니다. 문맥이 길어질수록 저장해야 할 정보가 증가해 긴 대화, 검색 문서, 도구 출력이 누적되는 Agentic workflow에서 병목이 됩니다. 이 모델은 Linear Attention 구간에서 KV cache 대신 제한된 Recurrent State를 사용합니다.
- FP8 정밀도(FP8 Precision)
- — 8비트 부동소수점 형식으로 모델 추론을 수행하는 방식입니다. FP8은 낮은 수치 정밀도를 사용해 메모리와 연산 부담을 줄이는 대신, 모델 품질과 수치 안정성을 함께 고려해야 합니다. NVIDIA GB300 NVL72에서 Qwen3.8-2.4T-A95B의 초기 성능 수치는 FP8 조건으로 측정됐습니다.
- NVIDIA NVLink Domain
- — 여러 GPU를 고속 연결해 GPU 사이의 데이터 교환을 단일 통신 영역처럼 처리하는 시스템 구성입니다. GB300 NVL72는 72개 NVIDIA Blackwell Ultra GPU를 130 TB/s 대역폭의 NVIDIA NVLink 영역으로 연결해 MoE Expert 간 all-to-all 통신 병목을 줄입니다. 대규모 모델 서빙에서는 Expert 요청이 전통적인 네트워크를 통과하는 횟수와 비용을 낮추는 역할을 합니다.
기술
- Qwen3.8-2.4T-A95B
- Qwen3.8-Max
- Mixture of Experts (MoE)
- Full Attention
- Linear Attention
- KV cache
- NVIDIA GB300 NVL72
- NVIDIA Blackwell Ultra
- NVIDIA NVLink
- TensorRT-LLM
- FP8
- NVFP4
- SGLang
- vLLM
- NVIDIA Dynamo
- NVIDIA NIM
- NVIDIA NeMo AutoModel
- PyTorch
- SFT
- LoRA
- Hugging Face
- ModelScope
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.