outsourc-e/Qwen3.8-27B-Unleashed-GGUF
텍스트 생성용 27B 모델의 GGUF 동적 양자화 배포판입니다.27B262K 컨텍스트Apache-2.0
13.2GB UD-Q3_K_XL이 262k 컨텍스트와 82.98% MMLU를 함께 확보합니다.
학습 방식 · Qwen3.8-27B-Uncensored를 기반으로 Unsloth Dynamic 3.0에서 추출한 per-tensor type map과 해당 base model의 imatrix를 적용한 GGUF 동적 양자화입니다. abliteration된 uncensored 가중치를 유지하며 UD-IQ1_M부터 UD-Q6_K까지 9개 tier를 제공합니다.
TL;DR
이 모델은 Qwen3.8-27B-Uncensored를 기반으로 Unsloth Dynamic 3.0의 per-tensor bit allocation과 imatrix를 적용한 동적 양자화 GGUF입니다. 권장 tier인 UD-Q3_K_XL은 13.2GB 크기에서 MMLU 82.98%를 기록하고 q4_0 KV cache와 함께 262,144토큰 컨텍스트를 유지합니다. Q3 이후에는 모델 크기와 PPL을 늘려도 task 점수가 개선되지 않으며, UD-Q6_K은 Q3_K_XL보다 8.9GB 크고 28% 느리지만 MMLU가 낮습니다. 20개 refusal 테스트에서는 0/20을 기록했고, 250,806토큰 exact-string retrieval도 통과했지만 multi-hop reasoning과 광범위한 vision 평가는 아직 없습니다.
핵심 포인트
- Qwen3.8-27B-Uncensored를 기반으로 Unsloth Dynamic 3.0의 per-tensor 양자화 맵과 imatrix를 적용한 GGUF입니다. 민감한 tensor에는 높은 정밀도를 유지하고 압축에 강한 tensor에는 더 낮은 bit를 배정합니다. 이 구조 덕분에 UD-Q3_K_XL이 더 큰 Q4 계열보다 낮은 PPL과 높은 MMLU를 기록했습니다.
- UD-Q3_K_XL은 13.2GB 크기로 24GB GPU에서 q4_0 KV cache와 262k 컨텍스트를 함께 사용할 수 있습니다. Qwen3.8의 65개 layer 중 full attention은 17개뿐이고 나머지는 linear 또는 DeltaNet 구조라 KV cache가 약 5GB로 제한됩니다. 권장 실행 구성은 llama.cpp에서 -c 262144와 q4_0 KV cache를 사용하는 방식입니다.
- 양자화 단계는 Q2에서 Q3로 올라갈 때 품질이 크게 개선되고 Q3 이후에는 점수가 평탄해지는 형태입니다. UD-Q3_K_XL은 MMLU 82.50%를 기록했으며 전체 570문항 측정에서는 82.98%를 기록했습니다. 반면 UD-IQ1_M은 25.83%로 4지선다 무작위 추측 수준이어서 사용 대상에서 제외해야 합니다.
- abliteration을 거친 uncensored 가중치를 사용해 20개 refusal 테스트에서 모든 tier가 0.0% refusal을 기록했습니다. 다만 uncensored가 정렬이나 거부 반응을 완전히 제거한다는 뜻은 아니며 원본 모델 카드도 예외 사례 가능성을 남깁니다. 250,806토큰 exact-string needle 검색은 통과했지만 다단계 추론 검색은 측정되지 않았습니다.
제한사항
- PPL은 실제 태스크 능력을 안정적으로 대변하지 않습니다. UD-IQ4_XS는 PPL 6.3502로 전체 tier 중 가장 낮았지만 MMLU 81.67%로 UD-Q3_K_XL의 82.50%보다 낮았습니다. 따라서 tier 선택에서는 PPL보다 MMLU와 실제 작업별 평가를 우선해야 합니다.
- 속도 수치는 RTX 4090 한 대에서 llama.cpp와 DFlash2 speculative decoding을 사용한 결과입니다. 이미지와 README 측정에서 생성 길이에 따른 median throughput은 짧은 출력 구간 23.6 tok/s에서 1000+ 토큰 구간 52.7 tok/s까지 달라졌습니다. 다른 하드웨어나 DFlash2가 없는 환경에서는 같은 수치를 기대할 수 없습니다.
- 250,806토큰 retrieval 평가는 exact-string needle 검색에 한정됩니다. 긴 문맥에서의 multi-hop reasoning과 image-heavy benchmark, OCR, multi-image prompt 성능은 측정되지 않았습니다. vision 기능을 쓰려면 별도 mmproj 파일이 필요하며 해당 projector는 약 0.93GB VRAM을 추가합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU 전체 570문항 | accuracy | 82.98% (473/570) | UD-Q3_K_XL 자체 측정값이며 stock Qwen3.8-27B bf16의 85.3%보다 2.3%p 낮음 |
| MMLU tier 비교 | accuracy | UD-Q3_K_XL 82.50% | UD-IQ4_XS 81.67%, UD-Q4_K_M 78.33%, UD-Q6_K 79.17%; 동일 ladder 측정값 |
| wikitext-2 Perplexity | PPL | UD-Q3_K_XL 6.4036 | UD-IQ4_XS 6.3502보다 높지만 MMLU는 82.50% 대 81.67%로 더 높음 |
| 250,806-token needle retrieval | exact-string retrieval | 성공 | UD-Q3_K_XL이 98% window occupancy에서 250,806토큰 needle을 회수함 |
| Refusal battery | refusal rate | 0.0% (0/20) | UD-Q3_K_XL 자체 측정값이며 uncensored 동작 확인용 20개 prompt 기준 |
| BenchLoop coding suite | pass count | 14/16 | 모든 양자화 tier에서 동일하게 측정되어 tier 간 차이를 구분하지 못함 |
이미지 분석




90
LIKES
17.3k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.