본문으로 건너뛰기

Qwen3.5-35B-A3B 모델, SWE-bench Verified Hard에서 37.8% 해결률 달성

소규모 MoE 모델인 Qwen3.5-35B-A3B에 단순한 편집 후 검증 루프를 도입하여 SWE-bench Verified Hard 벤치마크에서 대형 모델 수준의 성능을 기록했습니다.

실용적 조언

  • 코딩 에이전트를 설계할 때 파일 수정(file_edit) 직후에 반드시 테스트 코드를 실행하여 결과를 확인하도록 시스템 프롬프트를 구성하세요.
  • 소규모 모델을 사용할 때는 MCTS와 같은 무거운 탐색 기법 대신 단일 추론 경로 내에서 자기 비판(Self-Correction)을 유도하는 것이 효율적입니다.

섹션별 상세

01
Qwen3.5-35B-A3B 모델을 활용한 실험 환경을 구축했습니다. 이 모델은 총 35B 파라미터를 가졌지만 실제 추론 시에는 3B 파라미터만 활성화되는 가벼운 MoE(Mixture of Experts) 구조입니다. 저자는 vLLM을 추론 엔진으로 사용하고 파일 읽기, 편집, Bash 실행 등 최소한의 도구 세트를 갖춘 에이전트 하네스를 직접 제작하여 실험을 진행했습니다.
02
단순한 검증 전략이 성능 향상의 핵심이었습니다. 파일 편집 도구를 사용한 직후에 인라인 Python 코드나 임시 테스트 스크립트를 작성하여 변경 사항을 즉시 확인하도록 유도하는 메시지를 주입했습니다. 이 간단한 조치만으로 SWE-bench Verified Hard 태스크의 해결률이 22.2%에서 37.8%로 급상승했으며, 이는 40%를 기록한 Claude Opus 4.6과 대등한 수준입니다.
03
복잡한 탐색 기법인 MCTS(Monte Carlo Tree Search)나 Best-of-N 샘플링은 오히려 역효과를 냈습니다. 여러 변형된 트리 탐색 기법을 시도했으나 기본 베이스라인보다 낮은 성능을 보였으며, 검증 점수와 실제 문제 해결 간의 상관관계도 낮았습니다. 소규모 모델의 경우 복잡한 분기 탐색보다 일관된 추론 흐름을 유지하는 것이 성능 유지에 더 유리하다는 사실을 확인했습니다.

언급된 도구

Qwen3.5-35B-A3B추천

실험에 사용된 핵심 MoE 언어 모델

vLLM추천링크

로컬 모델 추론 및 서빙 엔진

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 04.수집 2026. 03. 04.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.