Qwen/Qwen3.8-Flash-Next
6B 활성화 MoE와 Qwen Sparse Attention으로 긴 문맥·멀티모달 에이전트 작업을 겨냥한 125B 모델
학습 방식 · Pre-training과 Post-training을 거친 Qwen3.8 계열의 실험적 Foundation Model이며, Muon과 AdamW를 Weight Category별로 적용했습니다. Refitted Scaling Law에 따라 Batch-size Warmup을 제거하고 목표 Batch Size에서 바로 학습을 시작해 Optimizer Step 수를 줄이는 방식입니다.
TL;DR
Qwen3.8-Flash-Next는 별도 Fine-tune이나 Quantized 파생물이 아닌, Pre-training과 Post-training을 거친 125B급 Causal Language Model with Vision Encoder입니다. 6B 활성화 MoE, Gated DeltaNet과 Micro-block 단위 Qwen Sparse Attention, Gated Residual, 51B N-gram Embedding을 결합해 전체 파라미터 규모와 토큰당 계산량을 분리합니다. 기본 262,144토큰 문맥을 처리하고 최대 1,000,000토큰까지 확장할 수 있어 긴 문서, 코드 저장소, 이미지 기반 에이전트 작업에 맞습니다. 공개 표에서 SWE-bench Pro 62.5, Toolathlon Verified Pass@1 73.5, AndroidWorld 84.5, GPQA Diamond 91.7을 기록했으며, 일부 비교군보다 높은 점수를 보였습니다.
핵심 포인트
- Qwen3.8-Flash-Next는 125B 전체 파라미터 중 6B만 활성화하는 Causal Language Model with Vision Encoder입니다. 512개 Expert 중 10개 Routed Expert와 1개 Shared Expert를 사용해 추론 시 계산량을 제한합니다. 51B N-gram Embedding과 4B MTP가 별도로 구성됩니다.
- Qwen Sparse Attention은 개별 토큰이 아니라 최대 512개 Micro-block 또는 2048개 토큰 단위로 선택합니다. Gated DeltaNet과 결합해 긴 문맥에서 처리할 정보량을 줄이는 구조입니다. 기본 문맥 길이는 262,144토큰이며 최대 1,000,000토큰까지 확장할 수 있습니다.
- Gated Residual은 데이터 의존적 Read Gate와 Branch별 Scalar Write Gate로 넓어진 Residual Stream의 정보 흐름을 조절합니다. 4개 Branch와 Bottleneck Rank 320을 사용해 Layer별 표현력을 세분화합니다. Residual 정규화의 안정성을 유지하면서 추론 오버헤드를 낮추도록 설계됐습니다.
- N-gram Embedding은 Layer 2에서 Bigram과 Trigram을 색인해 Embedding 파라미터를 확장합니다. 이 방식은 MoE보다 계산 부담이 적고 Offloading에 적합하다는 설계 의도를 가집니다. 제한된 메모리의 Accelerator에서 파라미터 규모를 키우는 경로로 활용됩니다.
제한사항
- 실험적 Preview 모델이므로 최종 Production 기능은 Qwen Cloud의 공식 Qwen3.8-Flash와 다를 수 있습니다. README는 Qwen3.8-Flash에 1M Context Length와 공식 내장 도구가 기본 제공된다고 구분합니다. 따라서 이 저장소의 모델 가중치만으로 동일한 관리형 서비스 기능을 가정하기 어렵습니다.
- 125B 파라미터와 51B N-gram Embedding을 포함하므로 전체 모델을 자체 인프라에서 운영할 때 메모리와 배포 비용이 큽니다. 6B 활성화 구조는 토큰당 계산량을 줄이지만 저장해야 할 전체 가중치 규모까지 줄이지는 않습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| DeepSWE 1.1 | score | 58.7 | Qwen3.8-27B 42.2, Qwen3.7-Plus 16.5, DeepSeek-V4-Flash-0731 54.4. 표에 함께 제시된 비교 수치 |
| SWE-bench Pro | score | 62.5 | Qwen3.8-27B 61.7, Qwen3.7-Plus 55.8, DeepSeek-V4-Flash-0731 56.0, Claude-Opus-4.6 (Max) 53.4. 표에 함께 제시된 비교 수치 |
| SWE-bench Multilingual | score | 81.0 | Qwen3.8-27B 73.8, Qwen3.7-Plus 75.8, Claude-Opus-4.6 (Max) 77.5. 표에 함께 제시된 비교 수치 |
| Toolathlon Verified | Pass@1 | 73.5 | Qwen3.8-27B 67.1, Qwen3.7-Plus 50.6, DeepSeek-V4-Flash-0731 70.3. 표에 함께 제시된 비교 수치 |
| GPQA Diamond | score | 91.7 | Qwen3.8-27B 89.2, Qwen3.7-Plus 90.3, DeepSeek-V4-Flash-0731 90.8, Claude-Opus-4.6 (Max) 91.3. 표에 함께 제시된 비교 수치 |
| LiveCodeBench v6 | score | 91.9 | Qwen3.8-27B 90.3, Qwen3.7-Plus 89.6, DeepSeek-V4-Flash-0731 90.6, Claude-Opus-4.6 (Max) 88.8. 표에 함께 제시된 비교 수치 |
| ClawEval-MM | Pass@3 / Average | 64.4 / 60.4 | Qwen3.8-27B 57.4 / 56.9, Qwen3.7-Plus 57.4 / 60.1, Claude-Opus-4.6 (Max) 52.5 / 54.7. 표에 함께 제시된 비교 수치 |
| AndroidWorld | score | 84.5 | Qwen3.8-27B 81.9, Qwen3.7-Plus 81.0, Claude-Opus-4.6 (Max) 62.0. 표에 함께 제시된 비교 수치 |
| OSWorld 2.0 | Binary / Partial | 19.4 / 52.3 | Qwen3.8-27B 19.4 / 48.0, Qwen3.7-Plus 2.8 / 21.5. 표에 함께 제시된 비교 수치 |
| MathVision | Without CI / With CI | 90.6 / 95.7 | Qwen3.8-27B 90.0 / 94.6, Qwen3.7-Plus 90.3 / 88.7. 표에 함께 제시된 비교 수치 |
| RealWorldQA | score | 88.5 | Qwen3.8-27B 85.9, Qwen3.7-Plus 86.9, Claude-Opus-4.6 (Max) 73.9. 표에 함께 제시된 비교 수치 |
이미지 분석

3.6k
LIKES
2.6k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.