본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

peculiar-ragdoll/Qwen-Sharp-Chat-Templates

Qwen3.5·3.6·3.8 모델의 응답 형식과 추론 효율을 조정하는 Chat Templateapache-2.0

Qwen 가중치는 그대로 두고 Chat Template만 바꿔 응답의 군더더기와 thinking 토큰을 줄이는 도구

TL;DR

Qwen-Sharp-Chat-Templates는 모델 가중치를 바꾸는 Fine-tune이나 양자화 모델이 아니라, froggeric/Qwen-Fixed-Chat-Templates v22.1을 기반으로 한 휴대형 Chat Template이다. Qwen3.5·3.6·3.8 모델의 기존 시스템 프롬프트를 보존하면서 서문·질문 반복·군더더기를 줄이는 11줄의 지시를 추가하고, upstream 템플릿의 thinking 보존과 reasoning-effort 제어를 그대로 사용한다. Qwen3.8-27B MMLU-Pro에서는 정확도가 83.3% ±1.7에서 85.3% ±0.9로 올라가고 정답당 시간이 71초에서 53초로 줄었으며, Claw-Eval에서는 점수가 상승하면서 답변 토큰이 59% 감소했다. MLX·llama.cpp·GGUF·transformers 환경에 파일 교체나 실행 옵션으로 적용할 수 있지만, 런타임이 읽는 템플릿 소스가 다르면 변경이 적용되지 않을 수 있다.

핵심 포인트

  • 가중치를 바꾸지 않는 템플릿이다. Qwen-Fixed-Chat-Templates v22.1을 기반으로 한다. 시스템 프롬프트에 간결한 답변 규칙 11줄을 덧붙인다.
  • 응답 전 불필요한 서문과 반복을 줄인다. 필요한 단계와 주의사항은 유지한다. 코드나 구조화된 결과에는 효과가 상대적으로 작을 수 있다.
  • 이전 턴의 thinking 블록을 보존한다. 캐시를 유지해 후속 요청의 재계산을 막는다. 대신 후속 턴의 첫 토큰까지 시간이 늘어날 수 있다.
  • MLX와 llama.cpp에서 파일 교체 또는 실행 옵션으로 적용한다. GGUF는 재양자화 없이 메타데이터만 갱신할 수 있다. 구형 런타임은 템플릿을 무시할 수 있어 중복 저장 확인이 필요하다.

제한사항

  • 모델 가중치를 학습하거나 지식을 추가하지 않는다. 응답을 유도하는 템플릿만 교체한다. 따라서 성능 변화는 사용하는 Qwen 모델마다 직접 측정해야 한다.
  • 모든 모델에 맞춰 개별 조정된 템플릿은 아니다. README의 주요 수치는 27B 모델에서 측정됐다. 4B 모델은 더 강한 지시가 필요할 수 있다.
  • 구형 런타임은 chat_template.jinja를 읽지 않을 수 있다. tokenizer_config.json에 남은 이전 템플릿과 두 소스가 불일치하면 적용이 조용히 실패한다. OpenAI API의 최상위 reasoning_effort 필드는 템플릿으로 전달되지 않는다.

벤치마크

벤치마크지표비교
MMLU-Proaccuracy85.3% ±0.9stock Qwen3.8-27B 83.3% ±1.7 대비 +2.0 pts
MMLU-Proseconds per correct answer53초stock 71초 대비 25% 빠름
Claw-Evalanswer score66.7stock ThinkingCap-Qwen3.6-27B 59.3 대비 +7.4 pts
Claw-Evaloverall score58.8stock 55.0 대비 +3.8 pts
Claw-Evalanswer tokens2217stock 5393 대비 59% 감소
SWE-bench-Livetasks fixed11/21stock Qwen3.8-27B 12/21보다 1개 적음
SWE-bench-Livemedian time to fix20.0stock 47.0 대비 2.3배 빠름
SWE-bench-Livemean time to fix33.9stock 63.2 대비 1.9배 빠름

이미지 분석

Qwen3.8-27B에서 동일한 6-bit 가중치로 stock 템플릿과 Sharp 템플릿의 MMLU-Pro 정확도와 정답당 처리 시간을 비교한 차트다.
중간 추론 강도와 3개 seed 조건에서 Sharp는 정확도를 83.3% ±1.7에서 85.3% ±0.9로 높이고 정답당 시간을 71초에서 53초로 낮췄다. 차트는 템플릿만 바꿔 정확도는 +2.0 points, 정답 도달 속도는 25% 개선됐다고 집계한다.
ThinkingCap-Qwen3.6-27B의 Claw-Eval에서 Sharp 템플릿과 stock 템플릿의 점수와 답변 토큰 수를 비교한 차트다.
동일한 6-bit 가중치와 temperature 1.0, 3개 seed에서 Sharp는 answer score를 59.3에서 66.7로, overall score를 55.0에서 58.8로 높였다. 답변 토큰은 5393에서 2217로 줄어 59% 감소했으며, 점수 변화는 0~100 절대 점수이고 토큰 변화는 상대값이다.
SWE-bench-Live에서 Sharp Qwen3.8-27B, stock Qwen3.8-27B, Opus 5와 Sonnet 5 등의 해결 과제 수와 수정 시간을 비교한 차트다.
21개 실제 오픈소스 저장소 작업에서 Sharp Qwen3.8-27B는 11개를 해결했고 stock은 12개를 해결했지만, 해결 가능한 작업의 중간 수정 시간은 20.0 대 47.0으로 Sharp가 2.3배 낮았다. 평균 수정 시간도 33.9 대 63.2로 낮았으며, 차트는 어려운 작업에서 중단하지 않고 평균 시간이 늘어나는 특성을 함께 표시한다.

112

Likes

0

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.