템플릿 호환성·MTP가 결합된 27B Coder GGUF 번들
Qwopus3.6-27B-Coder 기반의 GGUF 배포로 템플릿 레벨의 도구 호출 직렬화 호환성과 MTP 기반 추론 속도 향상을 제공한다.
TL;DR
이 릴리스는 Jackrong/Qwopus3.6-27B-Coder의 GGUF 번들로 템플릿 수준의 도구 호출 직렬화 호환성을 확장한 호환성 에디션이다. 사전 직렬화된 JSON 문자열과 구조화된 매핑·리스트 형태의 tool_call 인자를 동일하게 처리하도록 Jinja/llama.cpp/minja 렌더링 템플릿을 보완했으며, 모델 가중치와 MTP 예측 텐서는 변경하지 않고 weight-identical 검증을 진행했다. MTP 보조 헤드를 포함해 Q5_K_M GGUF 양자화와 결합하면 RTX 5090 환경에서 약 100 tokens/sec의 로컬 처리율을 달성할 수 있고, SWE-bench Verified no-thinking 평가에서 335/500로 67.0%를 기록했다. 이 구성은 로컬 에이전트 도구 호출의 형식 호환성과 실사용 응답성 개선을 목표로 하나, 가중치 변경이 없음을 명확히 하므로 모델 능력의 변화는 템플릿·런타임 호환성에 국한된다는 한계가 존재한다.
핵심 역량
- 로컬 환경에서 양자화된 27B 모델로 이미지와 텍스트 입력을 결합해 응답을 생성할 수 있으며, 대화형 에이전트 워크플로에서 도구 호출 페이로드를 그대로 유지한 채 처리할 수 있다.
- 다양한 도구 호출 표현을 수용하는 템플릿(미리 직렬화된 JSON 문자열·매핑·리스트)을 사용해 OpenAI 호환 도구 호출 히스토리를 재현하고, 여러 런타임에서 동일한 인자 보존을 유지하면서 작업을 수행할 수 있다.
- MTP 보조 헤드를 통한 speculative decoding을 이용해 로컬 추론 처리량을 높이고, Q5_K_M GGUF 양자화와 결합해 RTX 5090급 환경에서 약 100 tokens/sec 수준의 실사용 처리율을 확보할 수 있다.
강점
- 27B 규모의 밀집 모델 아키텍처를 바탕으로 레포지토리 수준의 코드 생성과 다중턴 도구 오케스트레이션을 처리할 수 있는 용량을 확보했다. 이로 인해 복잡한 멀티파일 의존성이나 디버깅 절차를 모델 내부에 더 잘 내재화할 수 있다. README에서는 단일 GPU 배포 가능성을 함께 명시했다.
- 로컬 배포용 Q5_K_M GGUF 양자화와 MTP 보조 헤드를 결합해 실사용 처리율을 끌어올렸고, RTX 5090 환경에서 약 100 tokens/sec의 처리율을 관측했다고 문서화되어 있다. 이러한 조합은 로컬 에이전트 응답성 향상과 실용적 인터랙션에 직접적인 이점을 제공한다.
- 템플릿 호환성 업데이트는 서로 다른 런타임과 도구 호출 직렬화 형식을 조정하여 실제 에이전트 환경에서 인자 손실 없이 도구 호출 히스토리를 유지하는 이점을 제공한다. README의 렌더링 검증 결과들이 그 호환성을 뒷받침하고 있다.
훈련 방식
이 모델은 Jackrong/Qwopus3.6-27B-Coder 기반으로 Trace Inversion과 고품질 agent trajectory를 포함한 SFT 파인튜닝 스택을 적용하고 Unsloth 기반 워크플로로 미세조정하여 에이전트형 코딩·도구 호출 패턴에 특화되었다.
알아두면 좋은 것
- 이번 릴리스는 템플릿 수준의 호환성 업데이트로서 tool_call.function.arguments의 여러 표현을 수용하도록 렌더링 템플릿을 확장했으며 모델 가중치와 MTP 예측 텐서는 변경하지 않았다.
- 두 개의 Q4_K_M GGUF 파일로 per-tensor SHA-256 매니페스트가 일치하는 866개 텐서에 대해 weight-identical 검증을 수행했고, 검증 환경은 llama.cpp 빌드 9733과 32K 컨텍스트로 기록되었다.
- MTP 검증 결과 MTP acceptance는 76.81%로 보고되었고, compat 템플릿은 공식 템플릿 대비 HF/minja 렌더링 항목에서 높은 호환성을 보였다(예: HF rendering 10/10 대 3/10).
- 라이선스는 Apache-2.0이고 다국어(영어·중국어·스페인어·러시아어·일본어)를 지원하며 transformers 프레임워크와 llama.cpp/llama.cpp-compatible 런타임에서의 엔드포인트 호환성을 표기하고 있다.
기술적 특징
- 템플릿 수준의 호환성 확장은 tool_call.function.arguments에 대해 사전 직렬화된 JSON 문자열, 구조화 매핑, 리스트 형태를 모두 허용하도록 Jinja 템플릿을 조정한 것이다. 이 변화는 모델 가중치나 MTP 텐서에 변화를 주지 않고도 다양한 에이전트 프레임워크에서 동일한 도구 호출 페이로드를 재현할 수 있게 만든다.
- weight-identical 검증이 per-tensor SHA-256 매니페스트를 사용해 두 개의 Q4_K_M GGUF 파일 전반의 866개 텐서에 대해 수행되어, 배포 파일이 원본 가중치와 동일함을 확인했다. 이 검증은 llama.cpp 빌드 환경과 특정 컨텍스트 설정에서 수행되어 로컬 배포 신뢰도를 보강한다.
- MTP(Multi-Token Prediction) 보조 헤드는 draft=2와 같은 설정으로 speculative decoding을 수행하여 디코딩 스루풋을 증가시키며, 모델 카탈로그에서는 동일 아키텍처의 MTP 변형이 표준 디코딩 대비 약 1.66배의 속도 개선을 보였다고 명시되어 있다. README는 MTP acceptance 비율과 초안 토큰 수락률(76.81%, 944/1,229)을 측정하여 품질·속도 트레이드오프를 수량화했다.
- Q5_K_M GGUF 양자화와 llama.cpp 호환 런타임 사용으로 27B 모델의 로컬 추론이 가능하도록 구성했으며, README에서는 RTX 5090 + MTP 환경에서 대략 100 tokens/sec라는 실측치를 제시했다. 이 조합은 로컬 에이전트와 인터랙티브 데모에서 응답성 향상을 목표로 한다.
차별점
- 템플릿 렌더링 호환성은 JSON-string 인자와 구조화된 매핑을 동일하게 수용하도록 설계되어 다양한 에이전트 프레임워크에서 도구 호출 표현 차이를 해소한다. 이 차별점은 런타임 간 인자 보존과 도구 호출 일관성 확보에 실질적 이점을 제공한다.
- 배포용 GGUF 파일에 대해 per-tensor SHA-256 매니페스트 검증을 통해 'weight-identical' 상태를 보장한 점이 특징으로, 이는 동일 가중치 보존을 전제로 한 호환성 주장의 신뢰도를 높였다. README에서 866개 텐서 일치 검증 사실을 명시하여 차별성을 뒷받침한다.
- MTP 보조 헤드와 번들된 예측 텐서를 통해 speculative decoding 성능을 공식적으로 측정·보고한 점이 드물게 구체적인 실사용 수치(예: 1.66x 속도 개선, 76.81% acceptance)를 제공한다. 이로 인해 로컬 추론 속도와 초안 품질의 트레이드오프를 정량적으로 판단할 수 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWE-bench Verified | accuracy | 67.0% | — |
| Local Throughput (RTX 5090 + MTP) | throughput | ~100 tokens/sec | — |
이미지 분석

104
Likes
83.1k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.