unsloth/Qwen3.8-2.4T-A95B-GGUF
2.4T MoE 구조와 장문 Thinking을 결합한 Qwen3.8 GGUF 양자화 모델
학습 방식 · Qwen/Qwen3.8-2.4T-A95B 기반의 post-trained 모델을 Unsloth Dynamic 2.0 방식으로 GGUF 양자화한 변환본입니다. README는 Qwen3.8이 pre-training과 post-training을 거쳤다고 밝히지만, 이 저장소 자체의 추가 Fine-tuning 방식은 명시하지 않습니다.
TL;DR
이 모델은 Qwen/Qwen3.8-2.4T-A95B를 기반으로 Unsloth Dynamic 2.0 방식으로 변환한 GGUF 양자화 모델이며, 전체 2.4T 파라미터 중 95B를 활성화하는 MoE 구조를 사용합니다. Gated DeltaNet과 Gated Attention을 결합하고 512개 Expert 중 10개 Routed Expert와 1개 Shared Expert를 선택해 텍스트 생성과 장기 Agent 작업을 처리합니다. Thinking 모드가 항상 켜지고 reasoning_effort로 추론 깊이를 조절하며, Context Length는 기본 262,144토큰에서 최대 1,010,000토큰까지 확장됩니다. README 기준 Terminal Bench 2.1에서 86.6, PaperBench에서 93.0, IFBench에서 82.8을 기록했지만 이미지 입력과 Thinking 비활성화는 지원하지 않습니다.
핵심 포인트
- Qwen3.8-2.4T-A95B를 기반으로 Unsloth Dynamic 2.0 방식으로 변환한 GGUF 양자화 모델입니다. 전체 2.4T 파라미터 중 95B만 활성화하는 MoE 구조를 사용합니다. 로컬 추론 환경에서 모델 크기와 연산량을 줄이는 목적에 맞습니다.
- 512개 Expert 중 라우팅 Expert 10개와 Shared Expert 1개를 활성화합니다. Gated DeltaNet과 Gated Attention을 결합해 92개 Layer를 구성합니다. 긴 문맥 처리와 선택적 Expert 계산을 함께 겨냥한 설계입니다.
- 모든 상호작용에서 Thinking 모드가 활성화되며 reasoning_effort로 추론 깊이를 조절합니다. xhigh, medium, low 세 단계를 제공하고 preserve_thinking은 기본 활성화 상태입니다. 이미지 입력과 Thinking 비활성화는 지원하지 않습니다.
- 네이티브 Context Length는 262,144토큰이며 최대 1,010,000토큰까지 확장할 수 있습니다. Reasoning Content에 최대 262,144토큰, 최종 응답에 최대 131,072토큰을 할당하도록 권장합니다. 장기 Agent 작업과 대규모 코드베이스 처리에 적합한 설정입니다.
제한사항
- 텍스트 전용 모델이라 이미지나 기타 멀티모달 입력을 처리하지 못합니다. 모든 응답이 <think> 블록을 포함하는 Thinking 모드로 시작합니다. Thinking을 끌 수 없으므로 짧은 응답이나 낮은 지연이 필요한 작업에는 부적합할 수 있습니다.
- 전체 파라미터가 2.4T이고 활성 파라미터도 95B에 달합니다. GGUF 양자화가 메모리 요구량을 낮추는 방향이지만 실제 실행 비용과 지원되는 Sampling Parameter는 추론 Framework에 따라 달라집니다. 배포 전 사용 환경에서 호환성을 확인해야 합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal Bench 2.1 | score | 86.6 | Qwen3.7-Max 74.5, GPT 5.6 Sol 88.8 |
| SWE-bench Pro | score | 67.7 | Qwen3.7-Max 60.6, Opus 4.8 69.2 |
| PaperBench | score | 93.0 | Qwen3.7-Max 64.8, GPT 5.6 Sol 90.5 |
| IFBench | score | 82.8 | Qwen3.7-Max 79.1, Opus 4.8 62.2 |
| MRCR v2 256K (8-needle) | score | 92.9 | Qwen3.7-Max 86.7, GPT 5.6 Sol 93.8 |
| LongBench v2 | score | 66.3 | Qwen3.7-Max 65.3, GPT 5.6 Sol 67.1 |
| HealthBench | score | 60.2 | Qwen3.7-Max 54.5, GPT 5.6 Sol 55.3 |
| WideSearch | score | 81.9 | Qwen3.7-Max 75.2, Fable 5 81.2 |
90
Likes
0
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.