본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

ukisai/Swift-Qwen3.8-27B-GGUF

이미지-텍스트 입력을 포함한 대화형 텍스트 생성과 reasoning, 코딩 작업27B262K 컨텍스트swift-open-license-1.0

Qwen3.8-27B 기반 Swift 모델을 GGUF로 양자화해 짧은 reasoning과 llama.cpp 실행을 지원

학습 방식 · Qwen3.8-27B를 기반으로 reasoning-marker 토큰 사용을 억제하는 Fine-tuning을 적용하고, ThinkingCap-Qwen3.6-27B에서 파생한 transfer component를 추가했습니다.

TL;DR

Swift-Qwen3.8-27B-GGUF는 Qwen3.8-27B에서 파생된 reasoning-efficient 모델 Swift-Qwen3.8-27B의 GGUF 양자화판으로, llama.cpp에서 텍스트와 이미지 입력을 처리합니다. reasoning-marker 토큰 사용을 억제하는 Fine-tuning과 ThinkingCap-Qwen3.6-27B에서 얻은 transfer component를 결합해 사고 과정의 평균 토큰을 줄입니다. BF16 비교에서 thinking token median이 최대 58.3% 감소했으며, GPQA-Diamond 점수는 88.38%에서 88.28%로 유지됐습니다. Q4_K_M부터 Q8_0까지 여러 GGUF 등급과 multimodal projector를 제공하고, MTP 기반 speculative decoding도 지원합니다.

핵심 포인트

  • reasoning-marker 토큰 사용을 줄이는 Fine-tuning으로 평균·중앙 사고 토큰을 낮춥니다.
  • Q4_K_M부터 Q8_0까지 제공해 메모리와 출력 품질 사이의 선택 폭을 넓힙니다.
  • 16개 full-attention 블록만 KV cache를 사용해 27B 모델의 토큰당 cache를 64 KiB로 유지합니다.
  • MTP 레이어와 multimodal projector를 포함해 speculative decoding과 이미지 입력을 함께 지원합니다.

제한사항

  • 이 저장소의 GGUF 파일 자체는 multimodal generation과 전체 benchmark suite로 재평가되지 않았으며, 표의 결과는 BF16 및 INT4 checkpoint에서 산출됐습니다.
  • 양자화 등급에 따라 장문 context의 KL divergence와 top-token agreement가 달라지므로 엄격한 tool-call 형식에는 Q6_K 이상이 권장됩니다.
  • 기본 4,096-token context는 긴 reasoning에서 부족하며, README는 LM Studio·koboldcpp·Jan AI에 최소 65,536-token 설정을 권장합니다.

벤치마크

벤치마크지표비교
GPQA-Diamondaccuracy88.28%Swift BF16 88.28% vs Qwen3.8-27B BF16 base 88.38%; Swift 평균 토큰 8,855, base 15,014, 평균 41.0% 감소·중앙값 58.3% 감소. 이 수치는 GGUF 파일 자체 측정값이 아님
MMLU-Proaccuracy84.95%Swift BF16 84.95% vs base 85.47%; 평균 토큰 1,603 대 2,980으로 46.2% 감소. 이 수치는 GGUF 파일 자체 측정값이 아님
C-Evalaccuracy90.62%Swift BF16 90.62% vs base 90.00%; 평균 토큰 804 대 1,492로 46.1% 감소. 이 수치는 GGUF 파일 자체 측정값이 아님
IFBenchaccuracy71.80%Swift BF16 71.80% vs base 73.53%; 평균 토큰 4,657 대 8,052로 42.2% 감소. 이 수치는 GGUF 파일 자체 측정값이 아님
AIME 2026accuracy94.00%Swift BF16 94.00% vs base 98.67%; 평균 토큰 16,143 대 22,014로 26.7% 감소. 이 수치는 GGUF 파일 자체 측정값이 아님
HMMT (Nov 2025)accuracy96.00%Swift BF16 96.00% vs base 99.33%; 평균 토큰 15,189 대 22,032로 31.1% 감소. 이 수치는 GGUF 파일 자체 측정값이 아님
ERQAaccuracy66.30%Swift BF16 66.30% vs base 67.45%; 평균 토큰 2,045 대 4,137로 50.6% 감소. 이 수치는 GGUF 파일 자체 측정값이 아님
Terminal-Bench 2.1score65.84%Swift BF16 65.84% vs base 66.74%; 평균 토큰 27,272 대 37,086으로 26.5% 감소. 이 수치는 GGUF 파일 자체 측정값이 아님
LiveCodeBench v6score81.55%Swift BF16 81.55% vs base 76.76%; 평균 토큰 8,615 대 11,374로 24.3% 감소. 이 수치는 GGUF 파일 자체 측정값이 아님
GPQA-Diamond INT4 W4A16accuracy88.38%Swift 88.38% vs 양자화 base 88.69%; 평균 thinking token 32.1% 감소, 중앙값 50.2% 감소. source model card의 W4A16 평가이며 이 GGUF 파일 측정값이 아님
IFBench INT4 W4A16accuracy71.25%Swift 71.25% vs 양자화 base 72.58%; 평균 completion token 30.1% 감소, 중앙값 38.0% 감소. source model card의 W4A16 평가이며 이 GGUF 파일 측정값이 아님
AIME 2026 INT4 W4A16accuracy84.00%Swift 84.00% vs 양자화 base 84.00%; 평균 completion token 19.0% 감소, 중앙값 37.5% 감소. source model card의 W4A16 평가이며 이 GGUF 파일 측정값이 아님
AIME 2026 AWQ INT4accuracy84.00%Swift 84.00% vs 양자화 base 82.67%; 평균 completion token 22.8% 감소, 중앙값 34.8% 감소. source model card의 AWQ 평가이며 이 GGUF 파일 측정값이 아님

93

LIKES

16.6k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.