Qwen/Qwen3.6-35B-A3B
텍스트·이미지·비디오를 입력받는 35B-A3B MoE 코딩 에이전트 비전-언어 모델35B-A3B262K 컨텍스트apache-2.0
35B 중 3B만 활성화해 27B 조밀 모델급 코딩 에이전트 성능을 내는 MoE 비전-언어모델
학습 방식 · 27B 조밀 모델과 같은 Gated DeltaNet+게이트 어텐션 하이브리드 구조에 256개 전문가(8라우팅+1공유) MoE를 결합해 사전학습·후처리했다.
TL;DR
Qwen3.6-35B-A3B는 27B 조밀 모델과 같은 Gated DeltaNet+게이트 어텐션 하이브리드 구조에 256개 전문가(8라우팅+1공유) MoE를 결합해 35B 총 파라미터 중 3B만 활성화하는 비전-언어 모델이다. 262,144토큰 네이티브 컨텍스트를 최대 101만 토큰까지 확장할 수 있고 thinking preservation과 이미지·비디오 입력을 함께 지원해, 활성 파라미터가 훨씬 적은데도 27B 조밀 모델에 근접한 SWE-bench Verified 73.4%, Terminal-Bench 2.0 51.5% 성적을 낸다. 이전 세대 Qwen3.5-35B-A3B 대비 코딩 에이전트 벤치마크 전반에서 개선됐으며, MoE 구조 덕분에 27B 조밀 모델보다 추론 비용이 낮다. 서버 비용을 아끼면서도 에이전틱 코딩 성능을 확보하려는 배포에 적합하다.
핵심 포인트
- 35B 중 3B만 활성화하는 MoE로 27B 조밀 모델과 유사한 하이브리드 어텐션 구조를 소형 활성 파라미터로 재현한다.
- 262K 네이티브, 최대 101만 토큰까지 확장 가능한 컨텍스트와 thinking preservation을 지원한다.
- 이미지·비디오 입력을 함께 처리하는 비전 인코더를 내장해 멀티모달 에이전틱 워크플로에 쓸 수 있다.
- 활성 파라미터가 적어 27B 조밀 모델보다 추론 비용이 낮으면서도 코딩 에이전트 벤치마크에서 근접한 성능을 낸다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWE-bench Verified | pass@1 | 73.4 | Qwen3.5-35B-A3B 대비 개선 |
| SWE-bench Multilingual | pass@1 | 67.2 | — |
| SWE-Bench Pro | pass@1 | 49.5 | — |
| Terminal-Bench 2.0 | pass@1 | 51.5 | — |
2.6k
LIKES
6M
DOWNLOADS
7 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.