본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Qwen/Qwen3.6-35B-A3B

텍스트·이미지·비디오를 입력받는 35B-A3B MoE 코딩 에이전트 비전-언어 모델35B-A3B262K 컨텍스트apache-2.0

35B 중 3B만 활성화해 27B 조밀 모델급 코딩 에이전트 성능을 내는 MoE 비전-언어모델

학습 방식 · 27B 조밀 모델과 같은 Gated DeltaNet+게이트 어텐션 하이브리드 구조에 256개 전문가(8라우팅+1공유) MoE를 결합해 사전학습·후처리했다.

TL;DR

Qwen3.6-35B-A3B는 27B 조밀 모델과 같은 Gated DeltaNet+게이트 어텐션 하이브리드 구조에 256개 전문가(8라우팅+1공유) MoE를 결합해 35B 총 파라미터 중 3B만 활성화하는 비전-언어 모델이다. 262,144토큰 네이티브 컨텍스트를 최대 101만 토큰까지 확장할 수 있고 thinking preservation과 이미지·비디오 입력을 함께 지원해, 활성 파라미터가 훨씬 적은데도 27B 조밀 모델에 근접한 SWE-bench Verified 73.4%, Terminal-Bench 2.0 51.5% 성적을 낸다. 이전 세대 Qwen3.5-35B-A3B 대비 코딩 에이전트 벤치마크 전반에서 개선됐으며, MoE 구조 덕분에 27B 조밀 모델보다 추론 비용이 낮다. 서버 비용을 아끼면서도 에이전틱 코딩 성능을 확보하려는 배포에 적합하다.

핵심 포인트

  • 35B 중 3B만 활성화하는 MoE로 27B 조밀 모델과 유사한 하이브리드 어텐션 구조를 소형 활성 파라미터로 재현한다.
  • 262K 네이티브, 최대 101만 토큰까지 확장 가능한 컨텍스트와 thinking preservation을 지원한다.
  • 이미지·비디오 입력을 함께 처리하는 비전 인코더를 내장해 멀티모달 에이전틱 워크플로에 쓸 수 있다.
  • 활성 파라미터가 적어 27B 조밀 모델보다 추론 비용이 낮으면서도 코딩 에이전트 벤치마크에서 근접한 성능을 낸다.

벤치마크

벤치마크지표비교
SWE-bench Verifiedpass@173.4Qwen3.5-35B-A3B 대비 개선
SWE-bench Multilingualpass@167.2
SWE-Bench Propass@149.5
Terminal-Bench 2.0pass@151.5

2.6k

LIKES

6M

DOWNLOADS

7 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.