MTP로 1.5–2x 추론 가속을 내세운 Qwen3.6-35B-A3B GGUF 변형
Unsloth가 배포한 Qwen3.6-35B-A3B GGUF는 MTP 기반으로 1.5~2배 추론 가속을 목표로 하는 시각·언어 통합형 대규모 언어모델로, 262,144 토큰 기본 컨텍스트와 MoE 아키텍처를 결합해 멀티모달 추론을 지원한다.
TL;DR
Unsloth가 배포한 Qwen3.6-35B-A3B GGUF 변형은 Gated DeltaNet과 대규모 MoE를 결합한 하이브리드 아키텍처를 기반으로 이미지-텍스트 결합 작업과 에이전트형 워크플로 지원을 목표로 설계되었다. 모델은 기본 262,144 토큰의 긴 문맥을 네이티브로 지원하며 MTP(Multi-Token Prediction)를 적용해 README에서 약 1.5~2배의 추론 가속을 보고하고 있다. 배포 측면에서는 GGUF 양자화와 llama.cpp, SGLang, vLLM 등 주요 서빙 툴과의 호환을 제공하며 Unsloth Studio가 하드웨어별 MTP 설정을 자동화해 실무적 배포 편의성을 높였다. 공개된 벤치마크 표는 코딩 에이전트, VQA, 지식·수리 벤치마크 등에서 경쟁력 있는 점수를 제시해 멀티모달·장기 문맥 작업에서 실용적 선택지를 제공함을 시사한다.
핵심 역량
- 이 모델은 이미지 입력을 함께 받아 질문응답과 설명형 텍스트 생성이 가능하며 비전 입력의 구조적·문맥적 요소를 텍스트로 변환할 수 있다. 모델은 대규모 컨텍스트(기본 262,144 토큰)를 활용해 긴 대화나 코드베이스의 전후관계를 유지하며 연속적 추론을 수행한다. 또한 에이전트 워크플로와 툴 호출을 지원하도록 설계되어 파일 편집·명령 실행 같은 리포지토리 수준의 작업 흐름을 처리할 수 있다.
- Qwen3.6은 MoE와 Gated DeltaNet 블록을 통해 입력에 따라 일부 전문가를 활성화하여 계산 자원을 절감하면서 다양한 태스크에서 고성능을 유지한다. 이 구조는 멀티모달 입력에서 정보 분산과 전문화된 처리 경로를 허용하여 VQA, 문서이해, 코드생성 등 서로 다른 작업 유형에서 동시 성능을 확보한다. 활성화된 일부 전문가만 연산에 참여하므로 전체 파라미터 대비 실제 연산 비용을 낮추는 장점이 있다.
- 배포 측면에서 GGUF 양자화된 가중치 형식을 제공해 로컬 환경과 llama.cpp 호환 런타임에서의 추론을 용이하게 하며 Unsloth Studio와 연동해 하드웨어에 맞춘 MTP 설정 자동화를 지원한다. 이로 인해 CPU/Metal 환경에서도 비교적 빠른 시작과 효율적 메모리 사용이 가능하다. README는 SGLang, vLLM 같은 서빙 엔진을 권장해 다양한 운영 시나리오에서의 호환성을 확보했다.
강점
- 긴 컨텍스트(262K 토큰 기준)를 네이티브로 지원해 리포지토리 수준의 코드 이해나 장기 대화 유지가 가능하며 README는 확장 컨텍스트 설정도 명시해 초대용량 문맥 처리가 가능함을 나타냈다.
- MTP와 GGUF 양자화 조합을 통해 로컬 및 서버 환경에서 추론 스루풋을 개선하는 배포 경로를 제공하며 README 내 벤치마크에서 1.5~2배 추론 속도 향상을 보고해 실무적 효율성을 강조했다.
- 모델 아키텍처에 MoE와 게이팅된 블록을 도입해 특정 태스크에서 활성 전문가만 연산에 참여시키는 방식으로 대형 파라미터의 표현력을 활용하면서 연산 비용을 줄이는 설계를 채택했다.
훈련 방식
기본적으로 대규모 사전학습에 후속 포스트트레이닝을 결합한 형태이며 아키텍처 측면에서 MoE를 포함한 하이브리드 블록(Gated DeltaNet → MoE, Gated Attention → MoE)을 사용해 멀티모달과 에이전트 워크플로에 특화된 능력을 강화했다.
알아두면 좋은 것
- Unsloth 배포판은 MTP를 통해 '약 1.5-2배' 추론 가속을 보고하며 GGUF 양자화와의 조합을 벤치마크 수치로 제시했다. README와 문서 링크는 Unsloth Studio에서 하드웨어별 최적 MTP 설정을 자동화한다고 명시해 사용자 경험을 단순화했다. 이러한 조합은 로컬·서버 양쪽 환경에서 추론 효율을 개선하려는 실무적 목적과 연결된다.
- 모델 아키텍처는 35B 총 파라미터(그중 약 3B 활성화)와 40개 레이어, Gated DeltaNet과 Gated Attention 블록을 포함한 하이브리드 구조를 사용하며 MoE 구성은 256개의 전문가와 요청당 8개 활성화 규칙을 따른다. 이 구조는 멀티모달 입력에 특화된 처리 경로와 긴 문맥 처리를 위해 설계되었으며 기본 컨텍스트 길이는 262,144 토큰으로 표기되어 있다. README는 확장 컨텍스트를 최대 1,010,000까지 확장 가능하다고 명시했다.
- README는 다양한 벤치마크 표를 제공해 코딩 에이전트, 일반 언어, 비전·VQA, 문서이해, 공간·비디오 이해 등 여러 카테고리에서 비교 점수를 제시했다. 문서에는 SWE-bench, QwenWebBench, MMLU-Pro, RealWorldQA 등 여러 공개·내부 벤치마크 수치가 포함되어 있어 모델의 강점과 약점을 파악할 근거를 제공한다. 또한 벤치마크 측정 조건(예: 온도, 컨텍스트, 타임아웃 등)을 별도 주석으로 기록해 결과 해석에 필요한 컨텍스트를 제공했다.
기술적 특징
- 아키텍처는 40개 레이어와 10×(3×(Gated DeltaNet → MoE) → 1×(Gated Attention → MoE)) 형태의 블록 레이아웃을 사용해 입력 처리의 단계별 특화가 가능하도록 설계되었다. 이 구조는 DeltaNet 계열의 변화량 기반 표현과 게이팅을 결합해 멀티모달 신호에서 정보 흐름을 제어하며, 레이어 내 MoE는 입력별 전문화를 통해 매우 큰 파라미터풀의 이점을 실용적으로 활용한다. 결과적으로 시각·언어 혼합 작업에서 복합적 추론 경로를 효율적으로 운영할 수 있다.
- Mixture of Experts 구성은 총 256개의 전문가를 두고 요청당 8개의 라우팅된 전문가와 1개의 공유 전문가를 활성화하도록 설정되어, 전체 파라미터 대비 실제 연산량을 줄이는 방식으로 효율을 확보한다. 이 라우팅 방식은 입력 특성에 따라 서로 다른 전문가 서브셋을 선택해 태스크별 전문성을 발현하게 하며 메모리·시간 비용의 트레이드오프를 관리한다. MoE 도입은 특히 대규모 모델에서의 성능-비용 균형을 맞추는 수단으로 활용된다.
- Gated DeltaNet 블록은 V와 QK에 대해 다른 선형 어텐션 헤드 수와 차원 분리를 적용해 시각 정보와 토큰 쌍의 상관을 더 세밀히 처리하도록 설계되었다. V에는 32개의 선형어텐션 헤드, QK에는 16개를 적용하고 헤드 차원을 분리하여 멀티모달 특징의 보존과 상호작용을 조절한다. 이 설계는 이미지-텍스트 융합에서 정보 손실을 줄이고, 긴 문맥에서의 안정적 추론을 돕는다.
- MTP(speculative multi-token prediction)는 추론 단계에서 여러 토큰을 드래프트로 미리 생성하고 후속 확정 단계에서 이를 활용해 반복 호출을 줄이는 방식으로 동작한다. Unsloth는 MTP 적용 시 약 1.5~2배의 처리속도 향상을 보고했으며 README는 MTP 설정을 SGLang, llama.cpp 등 서빙 엔진 옵션으로 노출해 실무 배포에서 활용하도록 구성했다. MTP는 특히 대용량 컨텍스트와 연속 예측이 많은 에이전트형 워크플로에서 비용과 지연을 동시에 개선하는 역할을 한다.
차별점
- Unsloth 배포판은 MTP를 기본 전제로 한 GGUF 변형을 제공해 로컬/클라우드 환경 모두에서 추론 처리량을 상향시키는 배포 전략을 채택했다. 이 전략은 양자화된 가중치와 MTP를 결합해 실사용 추론 성능을 최적화하려는 점에서 차별화된다.
- 아키텍처 수준에서 Gated DeltaNet과 대규모 MoE를 혼합한 하이브리드 블록 레이아웃을 사용해 멀티모달 입력 처리를 위한 표현 분리와 전문가 기반 전문화를 동시에 구현한 점이 구체적 차별점이다.
- 기본 컨텍스트 길이를 262,144 토큰으로 설계하고 최대 1,010,000 토큰까지 확장 가능하다고 명시해 긴 문맥을 필요로 하는 에이전트·코드·리포지토리 작업에서의 사용성을 강조한 점이 운영적 차별성으로 작용한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWE-bench Verified | score | 73.4 | — |
| Terminal-Bench 2.0 | score | 51.5 | — |
| QwenWebBench (Elo) | Elo | 1397 | — |
| MMLU-Pro | accuracy | 85.2 | — |
| RealWorldQA | score | 85.3 | — |
이미지 분석


658
Likes
727.5k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.