본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

outsourc-e/Qwen3.8-27B-Unleashed-GGUF

텍스트 생성용 27B 모델의 GGUF 동적 양자화 배포판입니다.27B262K 컨텍스트Apache-2.0

13.2GB UD-Q3_K_XL이 262k 컨텍스트와 82.98% MMLU를 함께 확보합니다.

학습 방식 · Qwen3.8-27B-Uncensored를 기반으로 Unsloth Dynamic 3.0에서 추출한 per-tensor type map과 해당 base model의 imatrix를 적용한 GGUF 동적 양자화입니다. abliteration된 uncensored 가중치를 유지하며 UD-IQ1_M부터 UD-Q6_K까지 9개 tier를 제공합니다.

TL;DR

이 모델은 Qwen3.8-27B-Uncensored를 기반으로 Unsloth Dynamic 3.0의 per-tensor bit allocation과 imatrix를 적용한 동적 양자화 GGUF입니다. 권장 tier인 UD-Q3_K_XL은 13.2GB 크기에서 MMLU 82.98%를 기록하고 q4_0 KV cache와 함께 262,144토큰 컨텍스트를 유지합니다. Q3 이후에는 모델 크기와 PPL을 늘려도 task 점수가 개선되지 않으며, UD-Q6_K은 Q3_K_XL보다 8.9GB 크고 28% 느리지만 MMLU가 낮습니다. 20개 refusal 테스트에서는 0/20을 기록했고, 250,806토큰 exact-string retrieval도 통과했지만 multi-hop reasoning과 광범위한 vision 평가는 아직 없습니다.

핵심 포인트

  • Qwen3.8-27B-Uncensored를 기반으로 Unsloth Dynamic 3.0의 per-tensor 양자화 맵과 imatrix를 적용한 GGUF입니다. 민감한 tensor에는 높은 정밀도를 유지하고 압축에 강한 tensor에는 더 낮은 bit를 배정합니다. 이 구조 덕분에 UD-Q3_K_XL이 더 큰 Q4 계열보다 낮은 PPL과 높은 MMLU를 기록했습니다.
  • UD-Q3_K_XL은 13.2GB 크기로 24GB GPU에서 q4_0 KV cache와 262k 컨텍스트를 함께 사용할 수 있습니다. Qwen3.8의 65개 layer 중 full attention은 17개뿐이고 나머지는 linear 또는 DeltaNet 구조라 KV cache가 약 5GB로 제한됩니다. 권장 실행 구성은 llama.cpp에서 -c 262144와 q4_0 KV cache를 사용하는 방식입니다.
  • 양자화 단계는 Q2에서 Q3로 올라갈 때 품질이 크게 개선되고 Q3 이후에는 점수가 평탄해지는 형태입니다. UD-Q3_K_XL은 MMLU 82.50%를 기록했으며 전체 570문항 측정에서는 82.98%를 기록했습니다. 반면 UD-IQ1_M은 25.83%로 4지선다 무작위 추측 수준이어서 사용 대상에서 제외해야 합니다.
  • abliteration을 거친 uncensored 가중치를 사용해 20개 refusal 테스트에서 모든 tier가 0.0% refusal을 기록했습니다. 다만 uncensored가 정렬이나 거부 반응을 완전히 제거한다는 뜻은 아니며 원본 모델 카드도 예외 사례 가능성을 남깁니다. 250,806토큰 exact-string needle 검색은 통과했지만 다단계 추론 검색은 측정되지 않았습니다.

제한사항

  • PPL은 실제 태스크 능력을 안정적으로 대변하지 않습니다. UD-IQ4_XS는 PPL 6.3502로 전체 tier 중 가장 낮았지만 MMLU 81.67%로 UD-Q3_K_XL의 82.50%보다 낮았습니다. 따라서 tier 선택에서는 PPL보다 MMLU와 실제 작업별 평가를 우선해야 합니다.
  • 속도 수치는 RTX 4090 한 대에서 llama.cpp와 DFlash2 speculative decoding을 사용한 결과입니다. 이미지와 README 측정에서 생성 길이에 따른 median throughput은 짧은 출력 구간 23.6 tok/s에서 1000+ 토큰 구간 52.7 tok/s까지 달라졌습니다. 다른 하드웨어나 DFlash2가 없는 환경에서는 같은 수치를 기대할 수 없습니다.
  • 250,806토큰 retrieval 평가는 exact-string needle 검색에 한정됩니다. 긴 문맥에서의 multi-hop reasoning과 image-heavy benchmark, OCR, multi-image prompt 성능은 측정되지 않았습니다. vision 기능을 쓰려면 별도 mmproj 파일이 필요하며 해당 projector는 약 0.93GB VRAM을 추가합니다.

벤치마크

벤치마크지표비교
MMLU 전체 570문항accuracy82.98% (473/570)UD-Q3_K_XL 자체 측정값이며 stock Qwen3.8-27B bf16의 85.3%보다 2.3%p 낮음
MMLU tier 비교accuracyUD-Q3_K_XL 82.50%UD-IQ4_XS 81.67%, UD-Q4_K_M 78.33%, UD-Q6_K 79.17%; 동일 ladder 측정값
wikitext-2 PerplexityPPLUD-Q3_K_XL 6.4036UD-IQ4_XS 6.3502보다 높지만 MMLU는 82.50% 대 81.67%로 더 높음
250,806-token needle retrievalexact-string retrieval성공UD-Q3_K_XL이 98% window occupancy에서 250,806토큰 needle을 회수함
Refusal batteryrefusal rate0.0% (0/20)UD-Q3_K_XL 자체 측정값이며 uncensored 동작 확인용 20개 prompt 기준
BenchLoop coding suitepass count14/16모든 양자화 tier에서 동일하게 측정되어 tier 간 차이를 구분하지 못함

이미지 분석

모델 크기와 MMLU 점수의 관계를 나타낸 그래프로 UD-Q3_K_XL이 13.2GB에서 82.5%로 최고점을 기록합니다.
그래프는 Q2 계열에서 Q3_K_XL로 이동할 때 MMLU가 70.8%와 70.8%에서 75.0%, 82.5%로 크게 상승하는 흐름을 나타냅니다. 이후 UD-IQ4_XS는 81.7%, UD-Q4_K_M은 78.3%, UD-Q5_K_M과 UD-Q6_K은 각각 79.2%로 내려가거나 정체됩니다. 양자화 크기를 계속 늘려도 task benchmark 점수가 자동으로 높아지지 않으며 Q3_K_XL이 품질과 크기의 변곡점이라는 해석을 뒷받침합니다.
Perplexity와 MMLU를 나란히 비교해 PPL 최저 tier와 실제 task benchmark 최고 tier가 다름을 나타낸 그래프입니다.
왼쪽 PPL 그래프에서는 UD-IQ4_XS가 약 6.35로 가장 낮지만 오른쪽 MMLU 그래프에서는 UD-Q3_K_XL이 82.5%로 가장 높습니다. UD-IQ4_XS는 PPL만 보면 유리하지만 1.1GB 더 크고 MMLU에서는 Q3_K_XL보다 낮은 점수를 냅니다. 이 비교는 언어 모델의 압축 품질을 선택할 때 PPL 하나만으로 capability를 판단하기 어렵다는 점을 시각적으로 뒷받침합니다.
응답에서 생성하는 토큰 수가 늘어날수록 median throughput이 23.6 tok/s에서 52.7 tok/s로 증가하는 막대그래프입니다.
1~100토큰 응답의 median throughput은 23.6 tok/s이고 101~400, 401~1000, 1000+ 구간에서는 각각 27.0, 35.2, 52.7 tok/s입니다. 짧은 요청은 prefill과 sampler 초기화, speculative decoding draft warm-up 같은 고정 비용을 적은 토큰에 나누어 부담하므로 처리량이 낮습니다. 따라서 tool call이나 짧은 acknowledgement가 많은 agent에서는 긴 문장을 생성하는 작업보다 낮은 속도를 예상해야 합니다.
모델 크기가 증가할수록 sweep median throughput이 77.0 tok/s에서 37.8 tok/s로 감소하고 Q3_K_XL이 52.2 tok/s를 기록하는 그래프입니다.
UD-IQ1_M은 6.8GB에서 77.0 tok/s로 가장 빠르지만 MMLU 25.8%에 그치며, UD-Q3_K_XL은 13.2GB에서 52.2 tok/s와 82.5% MMLU를 함께 기록합니다. 22.1GB의 UD-Q6_K은 37.8 tok/s까지 느려지지만 Q3_K_XL보다 높은 MMLU를 얻지 못합니다. 속도와 품질을 함께 고려하면 Q3_K_XL이 24GB급 GPU에서 실용적인 균형점으로 나타납니다.

90

LIKES

17.3k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.