본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

ukisai/Swift-Qwen3.8-27b

이미지와 텍스트를 함께 입력받아 reasoning 및 conversational 응답을 생성합니다.27B262K 컨텍스트swift-open-license-1.0

Qwen3.8-27B의 추론 정확도를 유지하면서 thinking token을 최대 58.3% 줄이는 Fine-tuning adapter 모델

학습 방식 · Qwen3.8-27B를 기반으로 reasoning-marker token 사용을 penalize하는 Fine-tuning을 적용하고, ThinkingCap-Qwen3.6-27B에서 파생한 transfer component를 결합했습니다.

TL;DR

Swift-Qwen3.8-27B는 Qwen3.8-27B를 기반으로 reasoning-marker token 사용을 억제하도록 Fine-tuning한 추론 효율화 adapter 모델입니다. 추론 중 과도한 사고를 유발하는 token을 줄여 더 짧은 reasoning trace를 생성하며, Qwen3.8-27B BF16 base와 비교해 thinking token을 최대 58.3% 줄였습니다. GPQA-Diamond에서는 정확도 88.38%에서 88.28%로 거의 유지하면서 median token을 58.3% 절감했고, LiveCodeBench v6에서는 정확도가 76.76%에서 81.55%로 올랐습니다. vLLM·SGLang·Transformers와 GGUF 환경을 지원하며, 짧은 추론과 양자화 배포를 함께 고려하는 개발 환경에 적합합니다.

핵심 포인트

  • Qwen3.8-27B의 reasoning-marker token 사용을 억제해 더 짧은 reasoning trace와 적은 thinking token을 생성합니다.
  • GPQA-Diamond에서 정확도 88.38% 대비 88.28%를 유지하면서 median token을 58.3% 줄입니다.
  • LiveCodeBench v6에서 token을 45.8% 줄이는 동시에 정확도를 76.76%에서 81.55%로 높입니다.
  • W4A16·AWQ INT4 평가에서도 token 절감이 이어져 메모리 절약형 배포와 결합하기 좋습니다.

제한사항

  • 평가 수치는 Qwen3.8-27B BF16 base와 동일 base에 Swift adapter를 붙인 비교이며, 다른 모델과의 비교 결과는 아닙니다.
  • 양자화 평가는 BF16 표와 별도 조건이며, AIME 2026에서는 짧은 output cap으로 잘린 답변을 오답 처리합니다.
  • Hugging Face 저장소가 gated 상태이므로 모델 파일을 직접 사용하려면 접근 권한이 필요합니다.

벤치마크

벤치마크지표비교
GPQA-Diamondaccuracy88.28%Qwen3.8-27B BF16 base 88.38% 대비 Swift 88.28%
GPQA-Diamondmedian thinking tokens reduction↓ 58.3%Qwen3.8-27B BF16 base 대비 Swift adapter의 median token 감소
GPQA-Diamondmean thinking tokens reduction↓ 41.0%Qwen3.8-27B BF16 base 대비 Swift adapter의 평균 token 감소
MMLU-Proaccuracy84.95%Qwen3.8-27B BF16 base 85.47% 대비 Swift 84.95%
C-Evalaccuracy90.62%Qwen3.8-27B BF16 base 90.00% 대비 Swift 90.62%
IFBenchaccuracy71.80%Qwen3.8-27B BF16 base 73.53% 대비 Swift 71.80%
AIME 2026accuracy94.00%Qwen3.8-27B BF16 base 98.67% 대비 Swift 94.00%
HMMT (Nov 2025)accuracy96.00%Qwen3.8-27B BF16 base 99.33% 대비 Swift 96.00%
ERQAaccuracy66.30%Qwen3.8-27B BF16 base 67.45% 대비 Swift 66.30%
Terminal-Bench 2.1accuracy65.84%Qwen3.8-27B BF16 base 66.74% 대비 Swift 65.84%
LiveCodeBench v6accuracy81.55%Qwen3.8-27B BF16 base 76.76% 대비 Swift 81.55%
LiveCodeBench v6mean token reduction↓ 24.3%Qwen3.8-27B BF16 base 대비 Swift adapter의 평균 token 감소
LiveCodeBench v6median token reduction↓ 45.8%Qwen3.8-27B BF16 base 대비 Swift adapter의 median token 감소
GPQA-Diamondmean thinking reduction at medium effort↓ 22.7%Qwen3.8-27B base의 medium reasoning effort 대비 Swift 평가
GPQA-Diamondmean thinking reduction at low effort↓ 25.8%Qwen3.8-27B base의 low reasoning effort 대비 Swift 평가
GPQA-Diamond W4A16accuracy88.38%동일 mixed-precision quant W4A16 base 88.69% 대비 Swift 88.38%
GPQA-Diamond W4A16mean thinking token reduction↓ 32.1%동일 mixed-precision quant W4A16 base 대비 Swift adapter
IFBench W4A16accuracy71.25%동일 mixed-precision quant W4A16 base 72.58% 대비 Swift 71.25%
IFBench W4A16mean completion token reduction↓ 30.1%동일 mixed-precision quant W4A16 base 대비 Swift adapter
AIME 2026 W4A16accuracy84.00%동일 mixed-precision quant W4A16 base 84.00%와 동일
AIME 2026 AWQ INT4accuracy84.00%동일 AWQ INT4 base 82.67% 대비 Swift 84.00%
AIME 2026 AWQ INT4mean completion token reduction↓ 22.8%동일 AWQ INT4 base 대비 Swift adapter

141

LIKES

459

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.