Qwen3.6-27B 기반 사고 토큰을 최대 50% 절감하는 brevity 파인튜닝 모델
이미지와 텍스트 입력을 받아 텍스트 출력을 생성하는 image-text-to-text 태스크를 수행한다. 본 모델은 시각적 컨텍스트를 포함한 질의에 대해 텍스트 응답을 생성하고 내부적으로 `<think>` 트레이스를 사용한 추론 과정을 유지한다. README 평가 항목은 reasoning, MCQ, 수학·코드, 장문 컨텍스트, 시스템 프롬프트 준수와 안전성 등 다양한 태스크별 성능과 사고 토큰 효율을 함께 측정한다.27B
Qwen3.6-27B를 최소 침투 방식으로 파인튜닝하여 내부 reasoning 트레이스 길이를 평균 약 50% 절감하면서 응답 품질을 유지한 multimodal image-text-to-text 모델이다.
TL;DR
ThinkingCap은 Qwen/Qwen3.6-27B를 기반으로 최소 침투형 파인튜닝을 적용해 내부 `<think>` 트레이스 길이를 단축시키는 모델이며, README에서는 평균 약 50%의 사고 토큰 절감과 최적 사례에서 90% 이상의 절감을 보고한다. 평가 프로토콜은 시드 반복과 paired 비교, 통계적 유의성 검정을 포함하여 reasoning·MCQ·수학·코드·장문·안전성 등 다수 벤치마크에서 사고 토큰 길이와 정확도를 함께 측정했다. 주요 실측치로 out-of-domain 매크로 평균 절감은 45.8%이고 in-domain 매크로 평균 절감은 57.7%이며 truncation과 같은 실패 모드도 유의미하게 감소했다. 모델은 transformers API와 GGUF 양자화 빌드를 통해 클라우드와 로컬(llama.cpp) 환경 모두에서 배포 가능한 형태로 제공된다.
핵심 역량
- 이미지와 텍스트를 함께 입력받아 텍스트 응답을 생성하는 multimodal 생성 능력을 제공한다.
- 내부 `<think>` 트레이스 길이를 줄여 동일 샘플에서 기저 모델 대비 평균적으로 사고 토큰을 절감할 수 있다.
- 다양한 reasoning 벤치마크와 일상 대화, 시스템 프롬프트 준수, 안전성 판정에 대해 기저 모델 수준의 응답 품질을 유지하도록 설계되어 있다.
- GGUF 양자화 빌드를 통해 로컬 추론 환경(llama.cpp 등)에서 용량과 메모리 요구를 줄인 형태로 배포할 수 있다.
강점
- 사고 토큰을 줄이면서 기저 모델 수준의 정확도와 응답 스타일을 보존하는 것을 목표로 설계되어 벤치마크에서 사고 토큰 절감과 품질 보존을 동시에 보고했다.
- 평가에서 시드 반복과 통계적 유의성 검정을 적용하여 결과의 변동성을 통제한 수치들을 제공한다.
- 안전성(guardrails) 관련 거부율은 기저 모델과 통계적으로 구분되지 않는 수준으로 유지되며 사고 토큰은 줄어든다는 점을 벤치마크로 확인했다.
훈련 방식
기저 모델 Qwen/Qwen3.6-27B를 기반으로 다양한 도메인과 난이도의 문제로 구성된 큐레이션된 데이터셋을 사용하여 최소 침투형 파인튜닝을 적용해 사고 토큰을 줄이는 방향으로 학습시켰다.
알아두면 좋은 것
- 기저 모델은 Qwen/Qwen3.6-27B이며 bottlecapai의 finetune 리레이션으로 제공되어 최소 침투 방식으로 사고 토큰 효율을 개선했다.
- 평가는 각 실험조건에서 시드 5개를 사용하고 온도 1.0 등 동일 샘플에 대해 paired 비교와 통계적 유의성 검정을 수행한 결과를 제시하고 있다.
- out-of-domain 매크로 평균 사고 토큰 절감은 45.8%로 보고되며 in-domain 매크로 평균 절감은 57.7%로 보고되었다.
- GGUF 양자화 빌드로 Q4_K_M(권장, 약 4.7비트/가중치)와 Q8_0(거의 무손실)를 제공하여 로컬 추론을 지원한다.
기술적 특징
- 사고 토큰 효율화는 모델 구조 변경 없이 파인튜닝 단계에서 이루어졌으며 README에서는 이를 'minimal invasive finetuning'으로 표현해 원본 응답 품질과 스타일을 보존하면서 내부 `<think>` 트레이스 길이를 단축하도록 설계되었다. 이 접근은 전체 파라미터 대규모 재설계 없이 추론 비용을 낮추는 실용적 트레이드오프를 제공한다.
- 평가 프로토콜은 동일 시드와 온도 설정에서 각 질문을 base와 비교하는 paired 방식을 사용하고 각 실험에 대해 5개 시드를 채택하여 평균과 95% 신뢰구간을 보고함으로써 단일 시드의 우연성을 낮추는 통계적 검정 절차를 적용했다. 이로 인해 사고 토큰 절감 수치와 정확도 변화 간의 의미 있는 비교가 가능하다.
- 러닝 실패 모드를 두 가지로 정의하여 모니터링했다. 하나는 루핑(looping)으로 동일한 추론 문구가 반복되는 현상이며 다른 하나는 트레이스가 토큰 한도에 걸려 답을 내지 못하는 절단(truncation)으로, README에서는 truncation 비율이 out-of-domain에서 2.9%→0.4%로, in-domain에서 1.6%→0.03%로 감소했다고 보고한다.
- 배포 측면에서는 transformers API를 통한 사용 예시와 함께 GGUF 양자화 빌드를 별도 리포에서 제공하여 로컬 llama.cpp 기반 추론과 호환되도록 설계했다. README에서는 Q4_K_M을 권장 품질-크기 균형으로 제시하고 Q8_0을 near-lossless 옵션으로 명시하여 양자화에 따른 품질 편차를 관리한다.
차별점
- 동일 질문에서 base 모델 대비 평균적으로 사고 토큰을 크게 절감하면서도 정확도를 거의 유지하도록 최소 침투형 파인튜닝을 적용한 점.
- 시드 반복과 통계적 유의성 검정을 포함한 엄격한 평가 프로토콜로 사고 토큰 절감과 품질 보존 간의 균형을 정량적으로 보고한 점.
- 루핑과 절단 같은 추론 실패 모드를 계량하여 실전 사용에서의 추론 안정성 변화를 함께 제시한 점.
- GGUF 양자화 빌드를 공식적으로 제공하여 로컬 추론 환경에서 사용자가 용량과 메모리 절약 효과를 누릴 수 있게 한 점.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Out-of-domain macro average | Thinking tokens reduction (macro average) | ↓ 45.8% | Base vs Ours paired average reduction reported in README |
| In-domain macro average | Thinking tokens reduction (macro average) | ↓ 57.7% | Base vs Ours paired average reduction on in-distribution holdouts |
| GPQA-Diamond | Accuracy | Base 85.5 ±1.4; Ours 83.8 ±1.9 | Thinking tokens 10,777 → 3,351 (↓ 67.8%) |
| GSM8K (in-domain) | Accuracy | Base 93.3 ±1.5; Ours 96.5 ±0.3 | Thinking tokens 3,175 → 648 (↓ 74.1%) |
이미지 분석

569
Likes
33.2k
Downloads
2 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.