peculiar-ragdoll/Qwen-Sharp-Chat-Templates
Qwen3.5·3.6·3.8 모델의 응답 형식과 추론 효율을 조정하는 Chat Templateapache-2.0
Qwen 가중치는 그대로 두고 Chat Template만 바꿔 응답의 군더더기와 thinking 토큰을 줄이는 도구
TL;DR
Qwen-Sharp-Chat-Templates는 모델 가중치를 바꾸는 Fine-tune이나 양자화 모델이 아니라, froggeric/Qwen-Fixed-Chat-Templates v22.1을 기반으로 한 휴대형 Chat Template이다. Qwen3.5·3.6·3.8 모델의 기존 시스템 프롬프트를 보존하면서 서문·질문 반복·군더더기를 줄이는 11줄의 지시를 추가하고, upstream 템플릿의 thinking 보존과 reasoning-effort 제어를 그대로 사용한다. Qwen3.8-27B MMLU-Pro에서는 정확도가 83.3% ±1.7에서 85.3% ±0.9로 올라가고 정답당 시간이 71초에서 53초로 줄었으며, Claw-Eval에서는 점수가 상승하면서 답변 토큰이 59% 감소했다. MLX·llama.cpp·GGUF·transformers 환경에 파일 교체나 실행 옵션으로 적용할 수 있지만, 런타임이 읽는 템플릿 소스가 다르면 변경이 적용되지 않을 수 있다.
핵심 포인트
- 가중치를 바꾸지 않는 템플릿이다. Qwen-Fixed-Chat-Templates v22.1을 기반으로 한다. 시스템 프롬프트에 간결한 답변 규칙 11줄을 덧붙인다.
- 응답 전 불필요한 서문과 반복을 줄인다. 필요한 단계와 주의사항은 유지한다. 코드나 구조화된 결과에는 효과가 상대적으로 작을 수 있다.
- 이전 턴의 thinking 블록을 보존한다. 캐시를 유지해 후속 요청의 재계산을 막는다. 대신 후속 턴의 첫 토큰까지 시간이 늘어날 수 있다.
- MLX와 llama.cpp에서 파일 교체 또는 실행 옵션으로 적용한다. GGUF는 재양자화 없이 메타데이터만 갱신할 수 있다. 구형 런타임은 템플릿을 무시할 수 있어 중복 저장 확인이 필요하다.
제한사항
- 모델 가중치를 학습하거나 지식을 추가하지 않는다. 응답을 유도하는 템플릿만 교체한다. 따라서 성능 변화는 사용하는 Qwen 모델마다 직접 측정해야 한다.
- 모든 모델에 맞춰 개별 조정된 템플릿은 아니다. README의 주요 수치는 27B 모델에서 측정됐다. 4B 모델은 더 강한 지시가 필요할 수 있다.
- 구형 런타임은 chat_template.jinja를 읽지 않을 수 있다. tokenizer_config.json에 남은 이전 템플릿과 두 소스가 불일치하면 적용이 조용히 실패한다. OpenAI API의 최상위 reasoning_effort 필드는 템플릿으로 전달되지 않는다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU-Pro | accuracy | 85.3% ±0.9 | stock Qwen3.8-27B 83.3% ±1.7 대비 +2.0 pts |
| MMLU-Pro | seconds per correct answer | 53초 | stock 71초 대비 25% 빠름 |
| Claw-Eval | answer score | 66.7 | stock ThinkingCap-Qwen3.6-27B 59.3 대비 +7.4 pts |
| Claw-Eval | overall score | 58.8 | stock 55.0 대비 +3.8 pts |
| Claw-Eval | answer tokens | 2217 | stock 5393 대비 59% 감소 |
| SWE-bench-Live | tasks fixed | 11/21 | stock Qwen3.8-27B 12/21보다 1개 적음 |
| SWE-bench-Live | median time to fix | 20.0 | stock 47.0 대비 2.3배 빠름 |
| SWE-bench-Live | mean time to fix | 33.9 | stock 63.2 대비 1.9배 빠름 |
이미지 분석



112
Likes
0
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.