Jackrong/Qwopus3.6-27B-Coder-MTP-GGUF
Qwopus3.6-27B-v2 기반으로 Trace Inversion과 에이전트 트레이스를 이용한 SFT로 파인튜닝된 27B 코더이며, GGUF 양자화와 MTP를 통해 로컬에서 빠른 툴 호출형 코드 생성·디버깅을 제공한다.
학습 방식 · Qwopus3.6-27B-v2를 기반으로 Trace Inversion으로 복원한 Claude Opus 추론 트레이스와 lambda/hermes 에이전트 트레이스를 결합해 SFT 파인튜닝을 수행하고, Unsloth로 메모리 최적화 및 3단계 커리큘럼(단문→중문→장문 컨텍스트)을 적용했다.
TL;DR
Qwopus-3.6-27B-Coder는 Qwopus3.6-27B-v2를 기반으로 Trace Inversion과 실제 에이전트 트레이스를 이용해 SFT로 파인튜닝된 27B 규모의 코더 모델이다. 압축된 상용 모델의 추론 '버블'을 역구성해 단계별 Chain-of-Thought를 학습 데이터로 삽입하고, 도구 정의와 실행 피드백을 포함한 멀티턴 트레이스를 통해 에이전트형 툴 호출과 리포지토리 수준의 코드 수정을 학습했다. 평가에서 Q5_K_M GGUF 양자화로 RTX 5090·MTP 환경에서 약 100 tokens/sec의 처리량을 확보했으며, SWE-bench Verified no-thinking 모드에서 335/500 = 67.0%를 기록해 로컬 환경에서의 실무적 코드 수선 역량을 입증했다. 단점으로는 포괄적 안전 평가와 광범위한 일반 영역 벤치마크가 아직 완료되지 않았고, 툴 호출 동작은 훈련에 사용된 프롬프트·툴 스키마와 밀접하게 연동되므로 배포 시 포맷 정합성이 필요하다.
핵심 포인트
- Trace Inversion을 통해 상용 모델의 압축된 추론을 역구성한 학습 데이터로 CoT를 복원하여 에이전트형 코드 작업에서 연속적 추론을 학습했다.
- 실제 에이전트 트레이스(툴 호출·환경 피드백 포함)를 SFT 데이터로 사용해 도구 호출 안정성과 멀티턴 실행 성능을 향상시켰다.
- MTP 기반 speculative decoding과 GGUF 양자화를 결합해 로컬 환경에서 높은 처리량(~100 t/s)과 실무적 응답성을 동시에 달성했다.
- 로컬 배포 실용성: Q5_K_M GGUF 양자화로 RTX 5090 환경에서 약 100 tokens/sec를 달성해 단일 GPU로 실용적 에이전트 운영이 가능하다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWE-bench Verified | score | 67.0% (335/500) | no-thinking mode; Q5_K_M GGUF on RTX 5090 + MTP |
| MMLU-Pro (base Qwopus3.6-27B-v2) | accuracy | 87.43% | base model reported result |
| SWE-bench Verified (base Qwopus3.6-27B-v2) | score | 75.25% | base model reported result |
이미지 분석

290
LIKES
245.1k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.