ukisai/Swift-Qwen3.8-27b
이미지와 텍스트를 함께 입력받아 reasoning 및 conversational 응답을 생성합니다.27B262K 컨텍스트swift-open-license-1.0
Qwen3.8-27B의 추론 정확도를 유지하면서 thinking token을 최대 58.3% 줄이는 Fine-tuning adapter 모델
학습 방식 · Qwen3.8-27B를 기반으로 reasoning-marker token 사용을 penalize하는 Fine-tuning을 적용하고, ThinkingCap-Qwen3.6-27B에서 파생한 transfer component를 결합했습니다.
TL;DR
Swift-Qwen3.8-27B는 Qwen3.8-27B를 기반으로 reasoning-marker token 사용을 억제하도록 Fine-tuning한 추론 효율화 adapter 모델입니다. 추론 중 과도한 사고를 유발하는 token을 줄여 더 짧은 reasoning trace를 생성하며, Qwen3.8-27B BF16 base와 비교해 thinking token을 최대 58.3% 줄였습니다. GPQA-Diamond에서는 정확도 88.38%에서 88.28%로 거의 유지하면서 median token을 58.3% 절감했고, LiveCodeBench v6에서는 정확도가 76.76%에서 81.55%로 올랐습니다. vLLM·SGLang·Transformers와 GGUF 환경을 지원하며, 짧은 추론과 양자화 배포를 함께 고려하는 개발 환경에 적합합니다.
핵심 포인트
- Qwen3.8-27B의 reasoning-marker token 사용을 억제해 더 짧은 reasoning trace와 적은 thinking token을 생성합니다.
- GPQA-Diamond에서 정확도 88.38% 대비 88.28%를 유지하면서 median token을 58.3% 줄입니다.
- LiveCodeBench v6에서 token을 45.8% 줄이는 동시에 정확도를 76.76%에서 81.55%로 높입니다.
- W4A16·AWQ INT4 평가에서도 token 절감이 이어져 메모리 절약형 배포와 결합하기 좋습니다.
제한사항
- 평가 수치는 Qwen3.8-27B BF16 base와 동일 base에 Swift adapter를 붙인 비교이며, 다른 모델과의 비교 결과는 아닙니다.
- 양자화 평가는 BF16 표와 별도 조건이며, AIME 2026에서는 짧은 output cap으로 잘린 답변을 오답 처리합니다.
- Hugging Face 저장소가 gated 상태이므로 모델 파일을 직접 사용하려면 접근 권한이 필요합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| GPQA-Diamond | accuracy | 88.28% | Qwen3.8-27B BF16 base 88.38% 대비 Swift 88.28% |
| GPQA-Diamond | median thinking tokens reduction | ↓ 58.3% | Qwen3.8-27B BF16 base 대비 Swift adapter의 median token 감소 |
| GPQA-Diamond | mean thinking tokens reduction | ↓ 41.0% | Qwen3.8-27B BF16 base 대비 Swift adapter의 평균 token 감소 |
| MMLU-Pro | accuracy | 84.95% | Qwen3.8-27B BF16 base 85.47% 대비 Swift 84.95% |
| C-Eval | accuracy | 90.62% | Qwen3.8-27B BF16 base 90.00% 대비 Swift 90.62% |
| IFBench | accuracy | 71.80% | Qwen3.8-27B BF16 base 73.53% 대비 Swift 71.80% |
| AIME 2026 | accuracy | 94.00% | Qwen3.8-27B BF16 base 98.67% 대비 Swift 94.00% |
| HMMT (Nov 2025) | accuracy | 96.00% | Qwen3.8-27B BF16 base 99.33% 대비 Swift 96.00% |
| ERQA | accuracy | 66.30% | Qwen3.8-27B BF16 base 67.45% 대비 Swift 66.30% |
| Terminal-Bench 2.1 | accuracy | 65.84% | Qwen3.8-27B BF16 base 66.74% 대비 Swift 65.84% |
| LiveCodeBench v6 | accuracy | 81.55% | Qwen3.8-27B BF16 base 76.76% 대비 Swift 81.55% |
| LiveCodeBench v6 | mean token reduction | ↓ 24.3% | Qwen3.8-27B BF16 base 대비 Swift adapter의 평균 token 감소 |
| LiveCodeBench v6 | median token reduction | ↓ 45.8% | Qwen3.8-27B BF16 base 대비 Swift adapter의 median token 감소 |
| GPQA-Diamond | mean thinking reduction at medium effort | ↓ 22.7% | Qwen3.8-27B base의 medium reasoning effort 대비 Swift 평가 |
| GPQA-Diamond | mean thinking reduction at low effort | ↓ 25.8% | Qwen3.8-27B base의 low reasoning effort 대비 Swift 평가 |
| GPQA-Diamond W4A16 | accuracy | 88.38% | 동일 mixed-precision quant W4A16 base 88.69% 대비 Swift 88.38% |
| GPQA-Diamond W4A16 | mean thinking token reduction | ↓ 32.1% | 동일 mixed-precision quant W4A16 base 대비 Swift adapter |
| IFBench W4A16 | accuracy | 71.25% | 동일 mixed-precision quant W4A16 base 72.58% 대비 Swift 71.25% |
| IFBench W4A16 | mean completion token reduction | ↓ 30.1% | 동일 mixed-precision quant W4A16 base 대비 Swift adapter |
| AIME 2026 W4A16 | accuracy | 84.00% | 동일 mixed-precision quant W4A16 base 84.00%와 동일 |
| AIME 2026 AWQ INT4 | accuracy | 84.00% | 동일 AWQ INT4 base 82.67% 대비 Swift 84.00% |
| AIME 2026 AWQ INT4 | mean completion token reduction | ↓ 22.8% | 동일 AWQ INT4 base 대비 Swift adapter |
141
LIKES
459
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.