Qwen3.6 기반 35B MoE 코드 에이전트, SWE-bench 69.4 성능
Qwen3.6-35B-A3B를 기반으로 SFT와 RL을 통해 에이전트형 코드 문제 해결 성능을 향상시킨 35B MoE 공개 개발판 모델이다.
TL;DR
KAT-Coder-V2.5-Dev는 Qwen3.6-35B-A3B를 기반으로 SFT 후 RL을 적용한 35B MoE 공개 개발판으로, 에이전트형 코딩 작업에서의 단위 테스트 통과율과 이상행동 억제를 목표로 설계되었다. 학습 파이프라인은 Token-in-Token-out으로 토큰 일관성을 유지하고 Truncated Importance Sampling으로 중요도 가중치 분산을 제어하며, 계층형 보상과 실행 피드백을 활용해 실패 시에도 의미 있는 진행에 보상을 준다. Qwen3.6에서 관찰된 병리적 병렬 도구 호출과 반복 생성에는 맞춤형 페널티를 도입해 RL 붕괴를 방지했고 그 결과 SWE-bench Verified 69.40과 PinchBench 93.43 같은 벤치에서 높은 성능을 보였다. 모델은 텍스트 전용 가중치만 공개되어 있고 기본 컨텍스트는 262,144 토큰이며 vLLM·SGLang 등 주요 서빙 스택과의 호환성을 통해 실무 배포가 용이하도록 구성되어 있다.
핵심 역량
- 에이전트 기반 코딩 워크플로에서 툴 호출을 포함한 복잡한 상호작용을 생성하고 실행 히스토리에 따라 행동을 조정할 수 있다.
- 단일 모델로 긴 문맥(기본 262,144 토큰)을 다루며 YaRN 설정을 통해 더 긴 시퀀스 처리가 가능하다.
- SFT로 얻은 지식과 RL로 보정된 보상 신호를 결합해 단위 테스트 통과율과 행동 이상 사례를 줄이는 방향으로 동작한다.
- 다국어 입력(영어·중국어)에 대한 코드 생성 및 에이전트 지시 처리를 지원한다.
강점
- 공개 벤치 결과에서 SWE-bench Verified 69.40과 PinchBench 93.43 등 코드 에이전트 관련 벤치에서 상위권 수치를 보이며 동급 규모 모델 대비 경쟁력 있는 성능을 보였다.
- 모델이 MoE 구조로 설계되어 전체 파라미터는 크지만 활성화 파라미터를 제한해 추론 시 계산 효율을 확보하는 설계적 장점이 있다.
- vLLM·SGLang·KTransformers 등 주요 서빙 스택과의 호환성을 명시해 실제 배포와 테스트가 비교적 용이하도록 배포 지침을 제공했다.
훈련 방식
Qwen3.6-35B-A3B를 기반으로 127K 예제의 데이터로 SFT를 수행한 뒤, 그 결과 모델에 대해 RL을 적용해 정책을 조정하는 두 단계 파이프라인을 사용했고 RL 단계에서는 TITO·TIS·검증기·계층형 보상 구조를 유지해 안정성을 확보했다.
알아두면 좋은 것
- 이 공개 릴리스는 텍스트 전용 가중치만 포함하며 비전/멀티모달 타워는 포함되지 않아 멀티모달 기능은 사용할 수 없다.
- 모델은 Qwen3.6-35B-A3B를 기반으로 후속 학습을 수행했으며 전체 파라미터는 35B, 활성화 파라미터는 약 3B이다.
- 훈련 파이프라인은 SFT 이후 RL을 적용하는 두 단계로 구성되며 RL 단계에는 TITO, TIS, 신뢰성 검증기, 계층형 보상 구조를 유지한다.
- 다수의 inference 프레임워크(vLLM, SGLang, KTransformers, transformers)와 호환되며 기본적으로 262,144 토큰의 컨텍스트를 지원한다.
기술적 특징
- Mixture-of-Experts 구조를 채택해 전체 파라미터는 35B 수준으로 유지하되 입력당 활성화되는 파라미터는 약 3B로 제한해 모델 용량과 추론 효율을 동시에 확보했다. MoE 라우팅은 특정 입력에서 소수의 전문가만 활성화함으로써 계산 비용을 줄이면서 높은 표현력을 유지한다. 이 설계는 에이전트형 작업에서 다양한 행동 패턴을 포착하는 데 유리하게 작용한다.
- 훈련 파이프라인은 Supervised Fine-Tuning(SFT) 후 Reinforcement Learning(RL)을 적용하는 형태로 구성되며 RL 단계에서 Token-in-Token-out, Truncated Importance Sampling, 신뢰성 검증기, 계층형 보상 구조를 핵심으로 유지했다. TITO는 롤아웃과 학습 간 토큰 시퀀스 일치성을 보장해 보상 신호 오염을 줄이고, TIS는 오프폴리시로 인한 분산을 낮춰 안정적 학습을 가능하게 한다. 계층형 보상은 실패한 시도에서도 의미 있는 진행에 보상을 제공해 학습 신호를 조밀하게 만든다.
- Qwen3.6 특이 행동을 완화하기 위해 RL 보상에 Qwen3.6 맞춤형 페널티를 추가했다. 병렬 툴 호출 과다, 실패한 툴 호출, 빈 툴 호출 블록, 반복 생성 등 특정 병리적 행동을 식별해 보상 체계에 페널티를 부과함으로써 툴 오용과 반복 패턴을 억제했다. 이 조정은 RL 학습의 붕괴를 방지하고 10 epoch 동안 안정적 학습을 달성하는 데 기여했다.
- 장기 문맥 처리를 위해 기본적으로 262,144 토큰을 지원하며 YaRN RoPE 구성으로 더 긴 컨텍스트를 처리하도록 구성 파일과 런타임 플래그를 통해 확장할 수 있다. YaRN 설정은 rope_parameters를 덮어쓰기 방식으로 작동하며 vLLM·SGLang·KTransformers 같은 런타임에서 활성화할 수 있다. 긴 대화 히스토리나 장기 코드베이스를 다루는 작업에서 컨텍스트 유지에 유리하다.
- 추론 및 배포 관점에서 vLLM과 SGLang에 최적화된 서빙 옵션을 제공하며, 텍스트 전용 로딩 플래그를 명시해 비전 가중치 부재로 인한 초기화 실패를 방지하도록 구성돼 있다. 또한 OpenAI 호환 API 예시를 포함해 현업에서 기존 OpenAI 호환 클라이언트로 통합하기 쉬운 배포 경험을 제공한다. 툴 호출 파서(qwen3_coder 등)와 reasoning-parser 옵션을 통해 에이전트 상호작용을 런타임에서 제어할 수 있다.
차별점
- Qwen3.6-35B-A3B를 기반으로 공개 가중치 형태로 MoE 구조를 제공하여 대규모 능력과 오픈 커뮤니티 접근성을 동시에 제공한다.
- 에이전트 실행 피드백을 이용한 계층형 보상과 Qwen3.6 특화 페널티를 결합해 툴 오용·반복 패턴을 억제하면서 RL 안정성을 확보했다.
- 기본 262,144 토큰 컨텍스트와 YaRN을 통한 확장 옵션을 명시해 긴 대화·코드 이력 처리가 가능한 실무 배포 설정을 지원한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWE-bench Verified | score | 69.40 | Qwen3.5-27B: 68.60, Qwen3.6-35BA3B: 64.40 (표에 기재된 동급 모델 값과 비교) |
| SWE-bench Multilingual | score | 63.00 | Qwen3.5-27B: 57.67, Qwen3.6-35BA3B: 57.00 (표에 기재된 동급 모델 값과 비교) |
| PinchBench | score | 93.43 | 동일 표의 다른 모델들과 비교해 최상위권 수치 |
| SciCode | score | 44.20 | Qwen3.5-27B: 25.58, Qwen3.6-35BA3B: 37.53 (표에 기재된 동급 모델 값과 비교) |
| Terminal-Bench 2.1 | score (avg) | 41.02 | 표에 제시된 per-harness 값은 32.60 / 49.44 (Terminus-2 / Claude Code) |
이미지 분석


349
Likes
9.2k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.