unsloth/Qwen3.6-35B-A3B-MTP-GGUF
Unsloth가 배포한 Qwen3.6-35B-A3B GGUF는 MTP 기반으로 1.5~2배 추론 가속을 목표로 하는 시각·언어 통합형 대규모 언어모델로, 262,144 토큰 기본 컨텍스트와 MoE 아키텍처를 결합해 멀티모달 추론을 지원한다.
학습 방식 · 기본적으로 대규모 사전학습에 후속 포스트트레이닝을 결합한 형태이며 아키텍처 측면에서 MoE를 포함한 하이브리드 블록(Gated DeltaNet → MoE, Gated Attention → MoE)을 사용해 멀티모달과 에이전트 워크플로에 특화된 능력을 강화했다.
TL;DR
Unsloth가 배포한 Qwen3.6-35B-A3B GGUF 변형은 Gated DeltaNet과 대규모 MoE를 결합한 하이브리드 아키텍처를 기반으로 이미지-텍스트 결합 작업과 에이전트형 워크플로 지원을 목표로 설계되었다. 모델은 기본 262,144 토큰의 긴 문맥을 네이티브로 지원하며 MTP(Multi-Token Prediction)를 적용해 README에서 약 1.5~2배의 추론 가속을 보고하고 있다. 배포 측면에서는 GGUF 양자화와 llama.cpp, SGLang, vLLM 등 주요 서빙 툴과의 호환을 제공하며 Unsloth Studio가 하드웨어별 MTP 설정을 자동화해 실무적 배포 편의성을 높였다. 공개된 벤치마크 표는 코딩 에이전트, VQA, 지식·수리 벤치마크 등에서 경쟁력 있는 점수를 제시해 멀티모달·장기 문맥 작업에서 실용적 선택지를 제공함을 시사한다.
핵심 포인트
- Unsloth 배포판은 MTP를 기본 전제로 한 GGUF 변형을 제공해 로컬/클라우드 환경 모두에서 추론 처리량을 상향시키는 배포 전략을 채택했다. 이 전략은 양자화된 가중치와 MTP를 결합해 실사용 추론 성능을 최적화하려는 점에서 차별화된다.
- 아키텍처 수준에서 Gated DeltaNet과 대규모 MoE를 혼합한 하이브리드 블록 레이아웃을 사용해 멀티모달 입력 처리를 위한 표현 분리와 전문가 기반 전문화를 동시에 구현한 점이 구체적 차별점이다.
- 기본 컨텍스트 길이를 262,144 토큰으로 설계하고 최대 1,010,000 토큰까지 확장 가능하다고 명시해 긴 문맥을 필요로 하는 에이전트·코드·리포지토리 작업에서의 사용성을 강조한 점이 운영적 차별성으로 작용한다.
- 긴 컨텍스트(262K 토큰 기준)를 네이티브로 지원해 리포지토리 수준의 코드 이해나 장기 대화 유지가 가능하며 README는 확장 컨텍스트 설정도 명시해 초대용량 문맥 처리가 가능함을 나타냈다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWE-bench Verified | score | 73.4 | — |
| Terminal-Bench 2.0 | score | 51.5 | — |
| QwenWebBench (Elo) | Elo | 1397 | — |
| MMLU-Pro | accuracy | 85.2 | — |
| RealWorldQA | score | 85.3 | — |
이미지 분석


658
LIKES
727.5k
DOWNLOADS
3 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.