27B 로컬 코더: 툴 호출과 리포지토리 수선에 최적화된 SFT 모델
Qwopus3.6-27B-v2 기반으로 Trace Inversion과 에이전트 트레이스를 이용한 SFT로 파인튜닝된 27B 코더이며, GGUF 양자화와 MTP를 통해 로컬에서 빠른 툴 호출형 코드 생성·디버깅을 제공한다.
TL;DR
Qwopus-3.6-27B-Coder는 Qwopus3.6-27B-v2를 기반으로 Trace Inversion과 실제 에이전트 트레이스를 이용해 SFT로 파인튜닝된 27B 규모의 코더 모델이다. 압축된 상용 모델의 추론 '버블'을 역구성해 단계별 Chain-of-Thought를 학습 데이터로 삽입하고, 도구 정의와 실행 피드백을 포함한 멀티턴 트레이스를 통해 에이전트형 툴 호출과 리포지토리 수준의 코드 수정을 학습했다. 평가에서 Q5_K_M GGUF 양자화로 RTX 5090·MTP 환경에서 약 100 tokens/sec의 처리량을 확보했으며, SWE-bench Verified no-thinking 모드에서 335/500 = 67.0%를 기록해 로컬 환경에서의 실무적 코드 수선 역량을 입증했다. 단점으로는 포괄적 안전 평가와 광범위한 일반 영역 벤치마크가 아직 완료되지 않았고, 툴 호출 동작은 훈련에 사용된 프롬프트·툴 스키마와 밀접하게 연동되므로 배포 시 포맷 정합성이 필요하다.
핵심 역량
- 리포지토리 내 버그 수정·패치 생성 및 단일·다중 파일 편집을 통한 테스트 통과 시도
- 툴 호출(함수형 도구 정의 포함)과 멀티턴 에이전트 행위 시퀀스 생성 및 실행 지시
- 코드 디버깅, 리팩터링 제안, DevOps 스크립트·환경 구성 제안
- 긴 컨텍스트(최대 수만 토큰)에서 연속적 추론과 재생(replay)을 통한 멀티턴 유지
- Thinking-off 모드에서 빠른 응답 생산(로컬 GGUF 양자화에서 높은 처리량)
강점
- 로컬 배포 실용성: Q5_K_M GGUF 양자화로 RTX 5090 환경에서 약 100 tokens/sec를 달성해 단일 GPU로 실용적 에이전트 운영이 가능하다.
- 코더 특화 성능: SWE-bench Verified no-thinking 모드에서 335/500 = 67.0%를 기록해 리포지토리 수준의 실무적 코드 수선 역량을 검증했다.
- 오픈 라이선스: Apache-2.0 라이선스로 상업적·연구용 활용이 자유롭다.
훈련 방식
Qwopus3.6-27B-v2를 기반으로 Trace Inversion으로 복원한 Claude Opus 추론 트레이스와 lambda/hermes 에이전트 트레이스를 결합해 SFT 파인튜닝을 수행하고, Unsloth로 메모리 최적화 및 3단계 커리큘럼(단문→중문→장문 컨텍스트)을 적용했다.
알아두면 좋은 것
- 모델은 Qwopus3.6-27B-v2를 기반으로 Trace Inversion으로 복원한 단계별 CoT와 실제 에이전트 트레이스(claude-opus-4.6/4.7 및 lambda/hermes)를 활용해 코더 SFT를 수행했다.
- 평가에서 Q5_K_M GGUF 양자화로 RTX 5090 + MTP 환경에서 약 100 tokens/sec의 처리량을 보고했으며, SWE-bench Verified no-thinking 모드에서 335/500 = 67.0%를 기록했다.
- MTP(Multi-Token Prediction) 변형을 통해 speculative decoding을 지원하며, Qwopus3.6-27B-v2-MTP 기준으로 약 1.66x의 속도 향상을 보고했다.
- 학습 파이프라인은 Unsloth를 이용한 메모리 최적화 파인튜닝과 3단계 커리큘럼(짧은 포맷 → 복잡도 확장 → 장문 컨텍스트 SFT)을 적용했다.
기술적 특징
- Trace Inversion 데이터 증강을 사용해 압축된 상용 모델의 추론 요약을 역구성하고 단계별 CoT를 복원해 학습 데이터로 삽입했다. 이로써 모델이 단순 정답 모방이 아닌 연속적 논리 전개를 학습하도록 하여 에이전트형 툴 호출과 멀티턴 추론에서 안정성을 확보했다.
- 에이전트 트레이스 기반 SFT를 통해 도구 정의, 실제 도구 호출 기록, 환경 피드백을 학습 데이터에 포함시켰다. 이 접근은 모델이 단일 출력 생성 대신 도구 사용 흐름(tool orchestration)을 계획하고 오류 복구 루틴을 생성하는 능력을 높였다.
- 세 단계 커리큘럼(Format Inception → Complexity Expansion → Long-Context SFT)을 적용해 먼저 포맷 안정성을 확보한 뒤 점진적으로 4k→8k→32k 토큰까지 긴 컨텍스트를 학습시켰다. 이로 인해 장문 멀티턴 추론 중 포맷 드리프트를 줄이고 <think> 태그 출력의 일관성을 유지했다.
- MTP(Multi-Token Prediction) 보조 헤드를 통해 speculative decoding을 지원해 표준 디코딩보다 약 1.66배 빠른 처리량을 달성했다. MTP는 초안 생성과 검증 흐름으로 응답 지연을 줄여 인터랙티브 개발 루프에 적합하다.
- Unsloth 기반의 메모리·학습 최적화를 활용해 27B급 모델의 파인튜닝과 로컬 평가를 단일 GPU 인프라에서 가능하게 했다. 이로 인해 실험 반복과 엔지니어링 비용이 낮아졌다.
차별점
- Trace Inversion을 통해 상용 모델의 압축된 추론을 역구성한 학습 데이터로 CoT를 복원하여 에이전트형 코드 작업에서 연속적 추론을 학습했다.
- 실제 에이전트 트레이스(툴 호출·환경 피드백 포함)를 SFT 데이터로 사용해 도구 호출 안정성과 멀티턴 실행 성능을 향상시켰다.
- MTP 기반 speculative decoding과 GGUF 양자화를 결합해 로컬 환경에서 높은 처리량(~100 t/s)과 실무적 응답성을 동시에 달성했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWE-bench Verified | score | 67.0% (335/500) | no-thinking mode; Q5_K_M GGUF on RTX 5090 + MTP |
| MMLU-Pro (base Qwopus3.6-27B-v2) | accuracy | 87.43% | base model reported result |
| SWE-bench Verified (base Qwopus3.6-27B-v2) | score | 75.25% | base model reported result |
이미지 분석

290
Likes
245.1k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.