empero-ai/Qwen3.8-9B-Distill-GGUF
추론 중심 텍스트 생성9Bapache-2.0
Qwen3.8 2.4T 지식을 9B로 증류한 GGUF 추론 모델
학습 방식 · Qwen3.8 2.4T A95B를 Qwen3.5-9B 구조에 full-parameter distillation한 empero-ai/Qwen3.8-9B를 기반으로 GGUF 양자화를 적용했습니다.
TL;DR
이 모델은 empero-ai/Qwen3.8-9B를 GGUF로 양자화한 배포판이며, 원본 모델은 Qwen3.8 2.4T A95B의 지식을 Qwen3.5-9B 구조에 full-parameter distillation한 reasoning 모델입니다. Q4_K_M 5.780GB부터 BF16 18.407GB까지 파일을 고를 수 있고, Q4_K_M은 8~12GB GPU에서 일상적인 사용을 겨냥한 품질·용량 균형형 선택지입니다. 응답마다 <think> 블록을 먼저 생성하므로 사용자 화면에 노출하지 않으려면 해당 구간을 제거해야 하며, Gated DeltaNet 지원이 포함된 최신 llama.cpp가 필요합니다.
핵심 포인트
- Qwen3.8 2.4T A95B의 지식을 Qwen3.5-9B 구조로 증류했습니다.
- Q4_K_M부터 BF16까지 다섯 가지 GGUF 양자화 파일을 제공합니다.
- Q4_K_M은 5.780GB로 품질과 메모리 사용량의 균형이 좋습니다.
- Gated DeltaNet 구조 때문에 최신 llama.cpp가 필요합니다.
제한사항
- Gated DeltaNet 레이어를 포함한 Qwen3.5 계열 구조라서 최신 llama.cpp의 해당 아키텍처 지원이 필요합니다. 구버전 빌드에서는 모델을 불러오지 못할 수 있습니다. Ollama와 LM Studio 같은 런타임도 내장 chat template와 호환되는 버전을 사용해야 합니다.
- 긴 컨텍스트에서는 모델 가중치보다 KV cache가 메모리를 크게 차지합니다. 따라서 낮은 비트 양자화를 선택해도 긴 대화에서는 추가 offload가 필요할 수 있습니다. Q8_0은 12~16GB GPU, BF16은 24GB 이상이 권장됩니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| mmlu (CoT, 57 subjects) | lm-evaluation-harness score | 0.751 | 기반 모델 Qwen3.5-9B의 공개 수치 0.546보다 +0.205이며, 이 GGUF 파일 자체의 측정값은 아닙니다. |
| gsm8k_cot | lm-evaluation-harness score | 0.870 | 기반 모델 Qwen3.5-9B의 공개 수치 0.885보다 −0.015이며, 이 GGUF 파일 자체의 측정값은 아닙니다. |
101
Likes
71.6k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.