토큰 효율형 35B MoE 코더 에이전트
이미지-텍스트 입력을 함께 처리해 코드 수정 지시, 파일 기반 패치 생성, 툴 호출 명령 및 멀티턴 디버깅 루프를 수행하는 멀티모달 에이전트형 텍스트 생성 태스크를 수행한다. 모델은 에이전트 하네스와 결합해 파일 열람, 테스트 실행, 오류 점검, 패치 제출 등의 순환 작업을 빠르게 처리하도록 설계되었다. 로컬 또는 경량화된 추론 스택에서 낮은 토큰 사용으로 잦은 턴을 지원하는 것이 핵심 목표이다.35B total / ~3B activeapache-2.0
Thinking-off 목표로 미세조정된 35B MoE 기반 멀티모달 코더 에이전트로서 토큰 효율성과 반복 툴 호출에서의 안정성을 높인다.
TL;DR
이 모델은 Qwopus3.6-35B-A3B-v1 및 Qwen3.6-35B-A3B 기반의 하이브리드 MoE 아키텍처를 출발점으로 Unsloth 워크플로우로 코딩·툴 사용 데이터에 맞춰 미세조정된 멀티모달 에이전트형 코더이다. 핵심 설계는 매 턴에서 긴 가시적 추론을 생략하고 더 빠르고 토큰 효율적인 실행 결정을 내리는 thinking-off 행동 목표이며, MoE 기반으로 토큰당 약 3B 활성 파라미터를 사용해 로컬 배포 적합성을 높였다. Q5_K_M 양자화된 빌드에서 수행된 SWE-bench 300 케이스 제출 패치 결과는 62.4%로 보고되었고, 종합 행동 점수는 Qwopus가 특정 실행 중심 지표에서 Ornith 대비 우위를 보였다. 다만 안전성 평가와 광범위한 일반 도메인 벤치마크는 아직 완료되지 않았으며 실제 배포에서는 툴 스키마·출력 파싱·리트라이 정책 등 하네스 구성의 세부가 결과에 큰 영향을 미친다.
핵심 역량
- 모델은 멀티모달 입력을 받아 코드 변경 지시를 생성하고 파일 단위의 패치 출력을 생성할 수 있다. 에이전트 하네스와 연동해 툴 호출을 선택하고 테스트를 반복 실행하는 짧은 루프에서 빠르게 다음 동작을 결정한다. 로컬 추론 환경에서 토큰 소비를 줄여 낮은 지연으로 다중 턴 워크플로를 유지할 수 있다.
- 모델은 툴 호출과 함수형 호출 포맷을 지원하도록 튜닝되어 외부 도구와의 인터페이스에서 일관된 출력 구조를 제공할 수 있다. 에러 기반 재시도와 요약 출력을 통해 반복 디버그 사이클을 순차적으로 관리한다. 이 과정에서 긴 가시적 추론을 생략해 응답 속도와 실행 안정성을 확보한다.
- 이미지-텍스트 투 텍스트 파이프라인을 통해 스크린샷이나 시각적 프로젝트 아티팩트를 참고하여 코드 수정 방향을 제시할 수 있다. README에 수록된 RTS 데모는 모델이 시각적 컨텍스트를 포함한 프로젝트 산출물을 생성할 수 있음을 보여준다. 멀티언어 입력(영어·중국어·스페인어·러시아어·일본어)을 지원하여 다양한 코드베이스 주석과 명세를 처리할 수 있다.
- 로컬 배포와 호환되는 양자화 및 MTP 보조 추론 설정을 적용해 메모리 발자국을 줄이고 높은 빈도의 코딩 루프를 가능하게 만든다. Q5_K_M 양자화 빌드로 벤치마크가 실행되었으며, 이로 인해 경량 추론 스택에서 실용적 성능이 확보되었다. 하네스의 툴 스키마 일관성과 출력 파싱이 성능에 직접적인 영향을 준다.
강점
- 실무형 에이전트 루프에서 토큰 효율성과 낮은 지연을 확보하도록 튜닝되어 로컬 개발 환경에서 잦은 툴 호출과 반복 테스트를 처리하는 데 유리하다. README의 목표와 벤치마크 결과는 thinking-off 모드에서 무결성·요청 준수·오케스트레이션 측면의 실용적 이점을 보여준다. 이러한 이점은 로컬 배포와 경량화된 추론 스택에서 체감 성능으로 이어질 가능성이 높다.
- MoE 기반 설계로 토큰당 활성 파라미터를 제한해 처리 효율을 확보함으로써 대용량 모델의 처리량-메모리 균형을 개선했다. Q5_K_M 양자화와 Unsloth 기반 미세조정은 메모리 최적화와 배포 실용성 측면에서 이점을 제공했다. README의 하드웨어 협업 언급은 실제 실험 환경에서의 검증이 병행되었음을 나타낸다.
훈련 방식
Qwopus3.6-35B-A3B-v1 및 Qwen3.6-35B-A3B 기반에서 Unsloth 워크플로우를 사용해 코딩·툴 사용 데이터로 에이전트 실행 성능을 중심으로 미세조정했다.
알아두면 좋은 것
- 이 모델 카드는 커뮤니티 실험 릴리스로서 연구와 로컬 코딩 에이전트 평가를 위해 공개되었다. 안전성 평가와 광범위한 일반 도메인 벤치마크는 아직 완료되지 않아 적용 시 주의가 필요하다. 개발자는 하네스, 툴 정의, 출력 파싱을 엄격히 구성할 것을 권고했다.
- 기반 아키텍처는 하이브리드 sparse MoE로 총 35B 파라미터와 토큰당 약 3B 활성 파라미터로 설계되어 높은 처리량과 로컬 적합성을 목표로 한다. Unsloth를 사용한 메모리 최적화된 미세조정 워크플로가 적용되었으며 README에서 Unsloth 문서 링크를 제공한다. 이러한 구성은 토큰 효율성과 낮은 지연을 통해 반복적 에이전트 작업을 실용적으로 수행하도록 의도되었다.
- 벤치마크 결과로는 Q5_K_M 양자화 빌드에서 진행된 SWE-bench 300 케이스 제출 패치 실행에서 62.4% 점수가 보고되었다. 비교 표에서 Qwopus는 thinking-off 모드에서 다중 턴 오케스트레이션, 무결성 및 요청 준수 같은 실무적 지표에서 우위를 보였다. 반면 Ornith-1.0의 thinking-on 설정은 장기적 회상과 메타인지 지표에서 강점을 유지했다.
- 모델 페이지에는 Kyle Hessling의 인터랙티브 데크와 OpenCode RTS 게임 데모 스크린샷이 포함되어 있어 시각적 검토가 가능하다. 데모는 대형 프로젝트 구조 유지, 상태 로직 일관성, 반복적 수정-테스트 사이클의 실용성을 검사하는 스모크 테스트로서 제공되었다. 데모는 형식화된 벤치마크는 아니지만 에이전트 실행의 가시적 산출물을 제공했다.
기술적 특징
- 하이브리드 sparse MoE 아키텍처를 기반으로 총 35B 파라미터를 유지하되 토큰당 약 3B만 활성화하도록 설계되어 계산 효율을 높인다. 이 구조는 로컬 환경에서 높은 처리량을 유지하면서 메모리 사용을 줄이는 목적에 부합한다. 활성 전문가 수 조절로 에이전트형 워크플로에서 반복적인 턴을 보다 효율적으로 처리할 수 있다.
- Thinking-off 목표로 미세조정하여 각 턴에서 긴 가시적 추론을 산출하지 않고 빠른 다음 단계 결정을 내리도록 최적화했다. 이 접근은 코드 편집, 테스트 실행, 오류 검사 같은 연속적 작업에서 토큰 낭비와 레이턴시를 줄이는 효과를 낸다. README에서는 이 전략이 워크플로 안정성과 반복 작업 완수율을 개선한다고 기술되었다.
- Q5_K_M 양자화와 MTP 보조 로컬 추론 설정을 통해 경량화된 빌드를 권장하고 벤치마크 역시 양자화된 빌드로 수행되었다. 양자화 적용은 로컬 추론 스택에서 메모리 발자국을 줄여 실사용 가능성을 높였다. README의 벤치마크들은 이러한 양자화된 설정에서 실행되었음을 명확히 표시했다.
- Unsloth 기반의 메모리 최적화된 미세조정 파이프라인을 사용해 대형 모델을 효율적으로 튜닝했다. 이 워크플로는 로컬 하드웨어와 협력하여 실험과 라이브 에이전트 테스트를 가능하게 했다. 문서에 하드웨어 협업 담당자로부터의 실험 데크와 데모 링크가 포함되어 있어 실제 검증 경로가 존재한다.
차별점
- 생각을 길게 늘이는 대신 실행을 중심으로 미세조정된 thinking-off 목표를 모델 설계의 핵심으로 삼아 에이전트 루프에서 토큰 효율과 안정성을 우선시했다. 이로 인해 반복적 툴 호출과 패치 제출 같은 작업에서 응답 속도와 상태 유지 성능을 강화했다. 동일 계열의 thinking-on 모델과 비교했을 때 다른 평가 항목에서의 우위를 보이는 점이 README에 제시되었다.
- 35B 총량의 MoE 설계를 통해 토큰당 활성 파라미터를 약 3B로 제한함으로써 로컬 고빈도 코딩 워크플로에 적합하도록 균형을 맞췄다. 이 설계는 완전 밀집 모델과 비교해 같은 수준의 전체 파라미터 예산에서 처리 효율을 개선하는 방향으로 작동한다. README에서는 이러한 아키텍처 결정이 로컬 배포 적합성에 기여한다고 명시했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWE-bench (300 cases) | score | 62.4% | Q5_K_M quantized build, thinking off, submitted patches |
| Average Score (behavioral composite) | average | 82.1 vs 78.9 | Qwopus (thinking off) vs Ornith (thinking on) |
이미지 분석

166
Likes
159.9k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.