ukisai/Swift-Qwen3.8-27B-GGUF
이미지-텍스트 입력을 포함한 대화형 텍스트 생성과 reasoning, 코딩 작업27B262K 컨텍스트swift-open-license-1.0
Qwen3.8-27B 기반 Swift 모델을 GGUF로 양자화해 짧은 reasoning과 llama.cpp 실행을 지원
학습 방식 · Qwen3.8-27B를 기반으로 reasoning-marker 토큰 사용을 억제하는 Fine-tuning을 적용하고, ThinkingCap-Qwen3.6-27B에서 파생한 transfer component를 추가했습니다.
TL;DR
Swift-Qwen3.8-27B-GGUF는 Qwen3.8-27B에서 파생된 reasoning-efficient 모델 Swift-Qwen3.8-27B의 GGUF 양자화판으로, llama.cpp에서 텍스트와 이미지 입력을 처리합니다. reasoning-marker 토큰 사용을 억제하는 Fine-tuning과 ThinkingCap-Qwen3.6-27B에서 얻은 transfer component를 결합해 사고 과정의 평균 토큰을 줄입니다. BF16 비교에서 thinking token median이 최대 58.3% 감소했으며, GPQA-Diamond 점수는 88.38%에서 88.28%로 유지됐습니다. Q4_K_M부터 Q8_0까지 여러 GGUF 등급과 multimodal projector를 제공하고, MTP 기반 speculative decoding도 지원합니다.
핵심 포인트
- reasoning-marker 토큰 사용을 줄이는 Fine-tuning으로 평균·중앙 사고 토큰을 낮춥니다.
- Q4_K_M부터 Q8_0까지 제공해 메모리와 출력 품질 사이의 선택 폭을 넓힙니다.
- 16개 full-attention 블록만 KV cache를 사용해 27B 모델의 토큰당 cache를 64 KiB로 유지합니다.
- MTP 레이어와 multimodal projector를 포함해 speculative decoding과 이미지 입력을 함께 지원합니다.
제한사항
- 이 저장소의 GGUF 파일 자체는 multimodal generation과 전체 benchmark suite로 재평가되지 않았으며, 표의 결과는 BF16 및 INT4 checkpoint에서 산출됐습니다.
- 양자화 등급에 따라 장문 context의 KL divergence와 top-token agreement가 달라지므로 엄격한 tool-call 형식에는 Q6_K 이상이 권장됩니다.
- 기본 4,096-token context는 긴 reasoning에서 부족하며, README는 LM Studio·koboldcpp·Jan AI에 최소 65,536-token 설정을 권장합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| GPQA-Diamond | accuracy | 88.28% | Swift BF16 88.28% vs Qwen3.8-27B BF16 base 88.38%; Swift 평균 토큰 8,855, base 15,014, 평균 41.0% 감소·중앙값 58.3% 감소. 이 수치는 GGUF 파일 자체 측정값이 아님 |
| MMLU-Pro | accuracy | 84.95% | Swift BF16 84.95% vs base 85.47%; 평균 토큰 1,603 대 2,980으로 46.2% 감소. 이 수치는 GGUF 파일 자체 측정값이 아님 |
| C-Eval | accuracy | 90.62% | Swift BF16 90.62% vs base 90.00%; 평균 토큰 804 대 1,492로 46.1% 감소. 이 수치는 GGUF 파일 자체 측정값이 아님 |
| IFBench | accuracy | 71.80% | Swift BF16 71.80% vs base 73.53%; 평균 토큰 4,657 대 8,052로 42.2% 감소. 이 수치는 GGUF 파일 자체 측정값이 아님 |
| AIME 2026 | accuracy | 94.00% | Swift BF16 94.00% vs base 98.67%; 평균 토큰 16,143 대 22,014로 26.7% 감소. 이 수치는 GGUF 파일 자체 측정값이 아님 |
| HMMT (Nov 2025) | accuracy | 96.00% | Swift BF16 96.00% vs base 99.33%; 평균 토큰 15,189 대 22,032로 31.1% 감소. 이 수치는 GGUF 파일 자체 측정값이 아님 |
| ERQA | accuracy | 66.30% | Swift BF16 66.30% vs base 67.45%; 평균 토큰 2,045 대 4,137로 50.6% 감소. 이 수치는 GGUF 파일 자체 측정값이 아님 |
| Terminal-Bench 2.1 | score | 65.84% | Swift BF16 65.84% vs base 66.74%; 평균 토큰 27,272 대 37,086으로 26.5% 감소. 이 수치는 GGUF 파일 자체 측정값이 아님 |
| LiveCodeBench v6 | score | 81.55% | Swift BF16 81.55% vs base 76.76%; 평균 토큰 8,615 대 11,374로 24.3% 감소. 이 수치는 GGUF 파일 자체 측정값이 아님 |
| GPQA-Diamond INT4 W4A16 | accuracy | 88.38% | Swift 88.38% vs 양자화 base 88.69%; 평균 thinking token 32.1% 감소, 중앙값 50.2% 감소. source model card의 W4A16 평가이며 이 GGUF 파일 측정값이 아님 |
| IFBench INT4 W4A16 | accuracy | 71.25% | Swift 71.25% vs 양자화 base 72.58%; 평균 completion token 30.1% 감소, 중앙값 38.0% 감소. source model card의 W4A16 평가이며 이 GGUF 파일 측정값이 아님 |
| AIME 2026 INT4 W4A16 | accuracy | 84.00% | Swift 84.00% vs 양자화 base 84.00%; 평균 completion token 19.0% 감소, 중앙값 37.5% 감소. source model card의 W4A16 평가이며 이 GGUF 파일 측정값이 아님 |
| AIME 2026 AWQ INT4 | accuracy | 84.00% | Swift 84.00% vs 양자화 base 82.67%; 평균 completion token 22.8% 감소, 중앙값 34.8% 감소. source model card의 AWQ 평가이며 이 GGUF 파일 측정값이 아님 |
93
LIKES
16.6k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.