Qwen/Qwen3.8-2.4T-A95B
텍스트 생성과 추론, 코딩, 전문 업무, 장기 에이전트 작업을 수행하는 Causal Language Model총 2.4T, 활성 95B262K 컨텍스트qwen3.8-max
2.4T MoE와 장문맥 추론으로 코딩·에이전트 작업을 겨냥한 Qwen 공개 모델
학습 방식 · Qwen3.5 아키텍처 기반의 사전 학습과 후속 학습을 거친 post-trained Causal Language Model입니다.
TL;DR
Qwen3.8-2.4T-A95B는 Qwen3.5의 아키텍처를 기반으로 사전 학습과 후속 학습을 거친 Qwen-Max급 공개 Causal Language Model입니다. 총 2.4T 파라미터 중 95B만 활성화하는 512-Expert MoE에 Gated DeltaNet과 Gated Attention을 결합해 코딩, 전문 업무, 연구, 장기 에이전트 작업을 겨냥합니다. 기본 262,144토큰 문맥을 최대 1,010,000토큰까지 확장할 수 있고 reasoning_effort로 추론 깊이를 조절하지만, 텍스트 전용이며 thinking mode를 끌 수 없습니다. README의 Qwen3.8-Max 기준 결과는 PaperBench 93.0, IFBench 82.8, Terminal Bench 2.1 86.6으로 에이전트와 지시 이행 작업에서 강한 수치를 기록했습니다.
핵심 포인트
- Qwen3.5의 아키텍처 기반 위에 사전 학습과 후속 학습을 적용한 Qwen-Max급 공개 모델입니다.
- 총 2.4T 파라미터 중 95B만 활성화하는 512개 Expert MoE 구조로 추론 시 연산 경로를 제한합니다.
- Gated DeltaNet과 Gated Attention을 결합해 긴 문맥 처리와 다단계 작업 수행을 지원합니다.
- reasoning_effort로 추론 깊이를 xhigh·medium·low로 조절하고 preserve_thinking으로 이전 추론 문맥을 유지합니다.
제한사항
- 텍스트 전용 모델이라 이미지 같은 Multimodal 입력을 처리하지 못합니다. 모든 상호작용에서 thinking mode가 필요하며 추론을 비활성화할 수 없습니다. 응답은 자동으로 <think>...</think> 형식의 추론 구간으로 시작합니다.
- 총 파라미터가 2.4T인 대규모 모델이라 일반적인 단일 모델 실행보다 전용 추론 환경 구성이 중요합니다. README는 SGLang, vLLM, TokenSpeed 같은 serving engine 사용을 권장합니다. 프레임워크별 추론 효율과 처리량 차이가 크므로 최신 버전과 호환성을 확인해야 합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal Bench 2.1 | score | 86.6 | Qwen3.8-Max 공식 버전의 공개 수치이며, 이 저장소의 Qwen3.8-2.4T-A95B 가중치를 직접 측정한 값이 아닙니다. |
| SWE-bench Pro | score | 67.7 | Qwen3.8-Max 공식 버전의 공개 수치이며, Qwen3.7-Max 60.6보다 높고 Opus 4.8 69.2보다 낮습니다. |
| PaperBench | score | 93.0 | Qwen3.8-Max 공식 버전의 공개 수치이며, GPT 5.6 Sol 90.5와 Opus 4.8 80.3보다 높습니다. |
| IFBench | score | 82.8 | Qwen3.8-Max 공식 버전의 공개 수치이며, 표에 있는 비교 모델 중 가장 높은 점수입니다. |
| HealthBench | score | 60.2 | Qwen3.8-Max 공식 버전의 공개 수치이며, GPT 5.6 Sol 55.3과 Qwen3.7-Max 54.5보다 높습니다. |
| MRCR v2 256K (8-needle) | score | 92.9 | Qwen3.8-Max 공식 버전의 공개 수치이며, Qwen3.7-Max 86.7보다 높고 GPT 5.6 Sol 93.8보다 낮습니다. |
461
Likes
978
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.