35B 멀티모달 에이전트 코딩 성능 공개
Qwen3.6-35B-A3B은 비전 인코더를 탑재한 causal LLM으로 35B 파라미터(활성화 3B), MoE 256·활성화 8+1 구조와 262,144 토큰 기본 컨텍스트를 제공하며 에이전트형 코딩과 긴 컨텍스트 유지를 강화했다.
TL;DR
Qwen3.6-35B-A3B은 Qwen3.5 계열의 피드백을 반영한 공개 가중치 멀티모달 언어 모델로, Vision Encoder가 결합된 causal LLM 구조를 채택하고 35B 파라미터(활성화 3B), 40개 레이어, Mixture of Experts 256개의 대규모 전문가 구성을 사용한다. 모델은 네이티브 262,144토큰의 긴 컨텍스트를 지원하며 Gated DeltaNet과 Gated Attention 블록, MTP 학습 설정을 통해 에이전트형 코딩과 멀티모달 질문응답에서 실무적 성능을 확보했다. 내부 벤치마크에서는 SWE-bench Verified 73.4, RealWorldQA 85.3, QwenWebBench Elo 1397 등에서 상위권 성적을 보였고 README는 vLLM·SGLang·KTransformers 등 서빙 엔진과의 호환성을 명시해 실제 배포 경로를 제시했다. 다만 긴 컨텍스트와 MoE 구조는 서빙 및 메모리 구성에서 추가적인 인프라 고려가 필요하다는 제한이 존재한다.
핵심 역량
- 에이전트형 코딩 작업에서 레포지토리·파일 수준의 추론을 수행하고 프론트엔드 워크플로를 자동화하는 응답을 생성할 수 있다. 모델은 도구 호출 파싱과 함께 코드 생성, 코드 수정, 단위 테스트 제안 등의 작업을 처리하도록 설정되었다. 내부 벤치마크에서 SWE-bench 계열과 QwenWebBench 등 코드 중심 평가에서 높은 점수를 기록했다.
- 멀티모달 입력을 받아 VQA와 문서 이해 작업에서 텍스트 답변을 산출할 수 있다. Vision Encoder가 결합된 구조로 이미지 기반 질문에 대한 정확한 텍스트 응답과 문서 OCR·해석에 적합한 출력 형식을 생성한다. RealWorldQA 및 OmniDocBench 계열에서 우수한 점수를 보였다.
- 긴 문맥 유지와 연속적 추론을 지원하여 대화형 개발 세션에서 과거 메시지의 추론 컨텍스트를 보존하는 기능을 제공한다. Thinking Preservation 옵션은 이전 메시지의 추론 상태를 유지해 반복 개발 시 불필요한 재생성 비용을 낮춘다. 모델은 네이티브로 262,144토큰을 처리하고 필요 시 1,010,000토큰까지 확장할 수 있다.
강점
- 코드·에이전트 벤치마크에서 높은 성능을 보였으며 SWE-bench Verified에서 73.4 점수를 기록했다. 이 수치는 동일 표의 비교 대상 모델들 가운데 상위권에 해당하며 에이전트형 코딩 작업에서 실무적 유용성을 뒷받침한다. 내부 QwenWebBench에서는 Elo 1397을 기록해 웹 프론트엔드 코드 생성 분야에서 강점을 드러냈다.
- 멀티모달 VQA 및 문서 이해 계열에서도 견고한 성능을 보였는데 RealWorldQA에서 85.3, OmniDocBench1.5에서 89.9를 기록했다. 이러한 점수는 시각-언어 태스크에서 일관된 정확도를 제공함을 시사하며 이미지-텍스트 통합 파이프라인의 적합성을 보여준다. Vision Encoder와 텍스트 생성 파이프라인의 결합이 실제적인 다중 입력 시나리오에서 효과를 냈다.
- 긴 컨텍스트 네이티브 지원(262,144토큰)과 확장 가능성은 문서·코드 베이스의 장기 의존성 문제를 다루는 데 강점으로 작용한다. README에서 128K 이상을 유지할 것을 권고한 점은 긴 컨텍스트가 모델의 추론 능력과 에이전트 행동 보존에 기여함을 모델팀이 확인했음을 의미한다. 이러한 설계는 반복적 개발 세션과 대규모 문서 처리 워크플로에 유리하다.
훈련 방식
모델은 사전학습(Pre-training) 후 실제 사용성 향상을 위한 포스트트레이닝(Post-training)을 거친 구조이며 Multi-Token Prediction(MTP) 설정과 다단계 학습 흐름을 적용했다. 이러한 후처리 단계는 에이전트형 코딩과 긴 컨텍스트 유지에 필요한 추론 행동을 안정화하도록 설계되었다. README는 구체적으로 MTP를 학습 과정에 포함했음을 명시하고 있어 추론 시 speculative·병렬 예측 전략과의 연계가 고려되었음을 알 수 있다.
알아두면 좋은 것
- 모델은 Hugging Face Transformers 포맷으로 공개된 가중치를 포함하고 있으며 vLLM, SGLang, KTransformers 등 주요 추론 프레임워크와 호환된다. README에 제시된 배포 커맨드와 권장 프레임워크는 대용량 컨텍스트와 멀티모달 추론에 맞춘 설정을 포함한다. 프로덕션 환경에서는 최신 프레임워크 버전과 전용 서빙 엔진을 권장한다.
- Model Overview에 따르면 모델 구조는 40개 레이어, hidden_dim 2048, Mixture of Experts 256, 활성화 전문가 8+1로 구성되어 있으며 Gated DeltaNet과 Gated Attention 블록을 혼합한 특이한 레이아웃을 사용한다. 토큰 임베딩과 LM 출력 차원은 각각 248,320으로 패딩되어 있고 이 구조는 멀티모달 표현과 에이전트 작업에서의 안정성을 높인다. MTP 학습 설정과 다양한 어텐션·헤드 구성은 모델의 코드·비전 혼합 능력에 직접적인 영향을 미친다.
- 기본 컨텍스트 길이는 262,144토큰이며 문서에는 128K 토큰 이상을 유지할 것을 권장하는 주의사항이 명시되어 있다. 컨텍스트를 줄이면 OOM을 피할 수 있으나 긴 컨텍스트가 필요한 복잡한 작업에서는 성능과 추론 능력이 저하될 수 있다. README는 컨텍스트 관련 설정을 조정할 때 메모리 분배와 서빙 프레임워크 옵션을 함께 고려할 것을 권고한다.
- 라이선스는 Apache-2.0으로 공개 가중치 형태로 배포되어 있어 상업적·연구용 통합이 가능한 형태이다. README에 오픈 가중치 최초 공개라는 점과 블로그 링크가 함께 제공되어 있고 개발자 커뮤니티 피드백을 반영한 포스트 트레이닝임이 명시되어 있다. 가중치와 구성 파일은 transformers 호환 포맷으로 제공되어 다양한 추론 엔진에서 바로 사용할 수 있다.
기술적 특징
- Qwen3.6의 핵심 아키텍처는 40개 레이어와 hidden_dim 2048을 기반으로 하며 반복적인 블록 레이아웃으로 10×(3×(Gated DeltaNet → MoE) → 1×(Gated Attention → MoE)) 구성을 채택했다. 이 레이아웃은 Gated DeltaNet을 통해 입력 변화에 민감한 중간 표현을 추출하고 MoE 블록이 표현 용량을 확장하도록 설계되었다. 결과적으로 계산 비용을 제한하면서도 모델의 표현력을 크게 확장하는 균형을 맞췄다.
- Mixture of Experts 구성은 총 256개 전문가를 두고 토큰당 8개의 라우팅 전문가와 1개의 공유 전문가를 활성화하는 방식으로 설계되었다. 라우팅된 소수의 전문가만 계산에 참여함으로써 전체 파라미터 용량을 효과적으로 활용하면서 추론 비용을 제어한다. 이 구조는 다양한 입력 특성(코드·텍스트·이미지)에 대해 전문화된 경로를 제공해 멀티태스크 성능을 끌어올리는 역할을 한다.
- 어텐션 계층은 Gated Attention을 도입해 Q/K/V 구성에 대해 차별화된 헤드 구성(예: Q 16헤드, KV 2헤드)과 헤드 차원 설정을 사용했다. Rotary Position Embedding 차원 64와 결합해 장기 의존성 처리에서 위치 정보를 안정적으로 유지하도록 설계되었다. 이러한 어텐션 설계는 특히 긴 컨텍스트 환경에서 안정적인 토큰 관계 추론을 가능하게 한다.
- Vision Encoder와의 결합을 통한 멀티모달 처리 파이프라인이 포함되어 이미지-텍스트 입력을 텍스트 응답으로 변환하는 데 최적화되었다. 모델은 문서 이해와 VQA 계열에서 높은 정확도를 보였으며 이미지 기반 질문에 대한 텍스트 출력을 생성하는 과정에서 시각적 특징을 효율적으로 통합한다. 또한 MTP 학습과 추론 설정을 통해 멀티토큰 예측 성능을 개선하여 코드 생성 등 연속적 생성 작업에서 이점을 제공한다.
- 배포 측면에서 transformers 포맷 가중치와 함께 vLLM, SGLang, KTransformers 등 상용·오픈소스 서빙 엔진과의 호환성을 확보했다. README에 제시된 샘플 커맨드는 텐서 병렬 설정과 컨텍스트 길이 제어를 통해 대규모 모델을 안정적으로 운영하는 방법을 구체적으로 보여준다. 서빙 프레임워크 선택은 처리량과 메모리 효율에 큰 영향을 미치므로 권장 설정을 따르는 것이 중요하다.
차별점
- 대규모 MoE 스케일과 게이트형 블록 조합을 통해 파라미터 용량과 연산 효율을 동시에 확보한 아키텍처가 차별점이다. 256명의 전문가와 토큰당 8명의 라우팅 전문가라는 구체적 설계는 다양한 입력 도메인에서 전문가별 특화 경로를 만들 수 있도록 한다. 이러한 구조는 특히 코드·멀티모달 작업에서 표현력과 효율성 사이의 균형을 제공한다.
- 네이티브로 262,144토큰을 처리하고 최대 1,010,000토큰까지 확장 가능한 컨텍스트 지원은 장기 의존성 및 문서 단위 작업에서 실질적 이점을 만든다. README에서 128K 이상 컨텍스트를 권장한 점은 모델의 장기 추론 능력이 컨텍스트 길이에 민감함을 시사한다. 긴 컨텍스트 처리 능력은 레포지토리 수준의 추론과 반복적 개발 세션에서 특히 유용하다.
- Thinking Preservation 옵션은 과거 메시지의 추론 컨텍스트를 보존하도록 설계되어 반복적 개발 과정의 불필요한 재생성을 줄인다. 이 기능은 에이전트형 워크플로에서 상태 유지를 통해 대화형 코드 작성의 효율을 높이는 역할을 한다. 모델팀이 에이전트 중심 성능을 목표로 포스트트레이닝을 적용한 점이 이러한 기능과 직결된다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWE-bench Verified | score | 73.4 | — |
| RealWorldQA | score | 85.3 | — |
| QwenWebBench | Elo | 1397 | — |
| MMLU-Redux | score | 93.3 | — |
| Terminal-Bench 2.0 | score | 51.5 | — |
이미지 분석

2.6k
Likes
6.1M
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.