Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
Qwopus3.6-27B-Coder 기반의 GGUF 배포로 템플릿 레벨의 도구 호출 직렬화 호환성과 MTP 기반 추론 속도 향상을 제공한다.
학습 방식 · 이 모델은 Jackrong/Qwopus3.6-27B-Coder 기반으로 Trace Inversion과 고품질 agent trajectory를 포함한 SFT 파인튜닝 스택을 적용하고 Unsloth 기반 워크플로로 미세조정하여 에이전트형 코딩·도구 호출 패턴에 특화되었다.
TL;DR
이 릴리스는 Jackrong/Qwopus3.6-27B-Coder의 GGUF 번들로 템플릿 수준의 도구 호출 직렬화 호환성을 확장한 호환성 에디션이다. 사전 직렬화된 JSON 문자열과 구조화된 매핑·리스트 형태의 tool_call 인자를 동일하게 처리하도록 Jinja/llama.cpp/minja 렌더링 템플릿을 보완했으며, 모델 가중치와 MTP 예측 텐서는 변경하지 않고 weight-identical 검증을 진행했다. MTP 보조 헤드를 포함해 Q5_K_M GGUF 양자화와 결합하면 RTX 5090 환경에서 약 100 tokens/sec의 로컬 처리율을 달성할 수 있고, SWE-bench Verified no-thinking 평가에서 335/500로 67.0%를 기록했다. 이 구성은 로컬 에이전트 도구 호출의 형식 호환성과 실사용 응답성 개선을 목표로 하나, 가중치 변경이 없음을 명확히 하므로 모델 능력의 변화는 템플릿·런타임 호환성에 국한된다는 한계가 존재한다.
핵심 포인트
- 템플릿 렌더링 호환성은 JSON-string 인자와 구조화된 매핑을 동일하게 수용하도록 설계되어 다양한 에이전트 프레임워크에서 도구 호출 표현 차이를 해소한다. 이 차별점은 런타임 간 인자 보존과 도구 호출 일관성 확보에 실질적 이점을 제공한다.
- 배포용 GGUF 파일에 대해 per-tensor SHA-256 매니페스트 검증을 통해 'weight-identical' 상태를 보장한 점이 특징으로, 이는 동일 가중치 보존을 전제로 한 호환성 주장의 신뢰도를 높였다. README에서 866개 텐서 일치 검증 사실을 명시하여 차별성을 뒷받침한다.
- MTP 보조 헤드와 번들된 예측 텐서를 통해 speculative decoding 성능을 공식적으로 측정·보고한 점이 드물게 구체적인 실사용 수치(예: 1.66x 속도 개선, 76.81% acceptance)를 제공한다. 이로 인해 로컬 추론 속도와 초안 품질의 트레이드오프를 정량적으로 판단할 수 있다.
- 27B 규모의 밀집 모델 아키텍처를 바탕으로 레포지토리 수준의 코드 생성과 다중턴 도구 오케스트레이션을 처리할 수 있는 용량을 확보했다. 이로 인해 복잡한 멀티파일 의존성이나 디버깅 절차를 모델 내부에 더 잘 내재화할 수 있다. README에서는 단일 GPU 배포 가능성을 함께 명시했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWE-bench Verified | accuracy | 67.0% | — |
| Local Throughput (RTX 5090 + MTP) | throughput | ~100 tokens/sec | — |
이미지 분석

104
LIKES
83.1k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.