empero-ai/Qwen3.8-9B-GGUF
GGUF 기반 텍스트 생성과 추론9Bapache-2.0
Qwen3.8 2.4T A95B를 9B 구조로 증류한 모델의 GGUF 양자화 배포판입니다.
학습 방식 · Qwen3.8 2.4T A95B를 Qwen3.5-9B architecture에 full-parameter distillation한 empero-ai/Qwen3.8-9B를 GGUF로 양자화했습니다.
TL;DR
Qwen3.8-9B-GGUF는 Qwen3.8 2.4T A95B의 지식을 Qwen3.5-9B architecture로 full-parameter distillation한 모델을 GGUF로 양자화한 배포판입니다. Q4_K_M은 5.780GB로 8~12GB GPU에서 일상적인 실행을 겨냥하며, Q8_0과 BF16은 더 큰 메모리로 품질 손실을 줄이는 선택지입니다. 원본 student 모델은 CoT 기준 MMLU 0.751로 Qwen3.5-9B base보다 0.205 높았지만 GSM8K CoT는 0.870으로 0.015 낮았습니다. Gated DeltaNet 혼합 구조 때문에 최신 llama.cpp 지원이 필요하고, 답변의 `<think>` 구간을 사용자에게 노출하지 않도록 후처리해야 합니다.
핵심 포인트
- Qwen3.8-9B는 Qwen3.8 2.4T A95B를 Qwen3.5-9B 구조에 증류한 모델입니다. 이 저장소는 이를 GGUF로 양자화해 llama.cpp 계열 런타임에서 실행합니다. 9B급 메모리 범위에서 대형 모델의 추론 능력을 활용하려는 구성이 핵심입니다.
- Q4_K_M 파일은 5.780GB로 대부분의 사용자에게 권장되는 품질·용량 균형을 제공합니다. Q5_K_M은 6.643GB, Q6_K은 7.559GB, Q8_0은 9.786GB입니다. BF16 기준 파일은 18.407GB이며 24GB 이상 GPU가 권장됩니다.
- Qwen3.5 계열은 Full Attention 층마다 Gated DeltaNet 층 3개를 배치한 혼합 구조입니다. 따라서 Qwen3.5와 Gated DeltaNet을 지원하는 최신 llama.cpp 빌드가 필요합니다. 구형 빌드는 아키텍처를 불러오지 못할 수 있습니다.
제한사항
- 이 모델은 Qwen3.5와 Gated DeltaNet 지원이 포함된 최신 llama.cpp 빌드를 요구합니다. 지원이 없는 구형 빌드에서는 모델 아키텍처를 로드하지 못합니다. 따라서 실행 전 런타임 버전과 구조 지원 여부를 확인해야 합니다.
- 추론 답변은 `<think>` 블록으로 시작하므로 일반 사용자 화면에 그대로 출력하면 내부 추론 구간이 노출될 수 있습니다. README는 충분한 `-n` 값을 할당한 뒤 `<think>...</think>` 구간을 제거하도록 안내합니다. 긴 추론을 처리할 때는 출력 토큰 예산도 함께 조정해야 합니다.
- 긴 컨텍스트에서는 가중치 양자화보다 KV cache가 메모리 사용량을 지배합니다. 이에 따라 Q4_K_M이나 Q5_K_M을 선택해도 긴 대화에서는 추가 offload가 필요할 수 있습니다. README는 일상적인 짧은 컨텍스트 기준으로 Q4_K_M과 Q5_K_M에 8~12GB 카드를 권장합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| mmlu (CoT, 57 subjects) | accuracy | 0.751 | Qwen3.5-9B base 0.546 대비 +0.205; 원본 student 모델 평가 수치로 GGUF 양자화 파일 자체의 측정값이 아님 |
| gsm8k_cot | accuracy | 0.870 | Qwen3.5-9B base 0.885 대비 −0.015; 원본 student 모델 평가 수치로 GGUF 양자화 파일 자체의 측정값이 아님 |
91
Likes
38.3k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.