본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

empero-ai/Qwen3.8-9B-Distill-GGUF

추론 중심 텍스트 생성9Bapache-2.0

Qwen3.8 2.4T 지식을 9B로 증류한 GGUF 추론 모델

학습 방식 · Qwen3.8 2.4T A95B를 Qwen3.5-9B 구조에 full-parameter distillation한 empero-ai/Qwen3.8-9B를 기반으로 GGUF 양자화를 적용했습니다.

TL;DR

이 모델은 empero-ai/Qwen3.8-9B를 GGUF로 양자화한 배포판이며, 원본 모델은 Qwen3.8 2.4T A95B의 지식을 Qwen3.5-9B 구조에 full-parameter distillation한 reasoning 모델입니다. Q4_K_M 5.780GB부터 BF16 18.407GB까지 파일을 고를 수 있고, Q4_K_M은 8~12GB GPU에서 일상적인 사용을 겨냥한 품질·용량 균형형 선택지입니다. 응답마다 <think> 블록을 먼저 생성하므로 사용자 화면에 노출하지 않으려면 해당 구간을 제거해야 하며, Gated DeltaNet 지원이 포함된 최신 llama.cpp가 필요합니다.

핵심 포인트

  • Qwen3.8 2.4T A95B의 지식을 Qwen3.5-9B 구조로 증류했습니다.
  • Q4_K_M부터 BF16까지 다섯 가지 GGUF 양자화 파일을 제공합니다.
  • Q4_K_M은 5.780GB로 품질과 메모리 사용량의 균형이 좋습니다.
  • Gated DeltaNet 구조 때문에 최신 llama.cpp가 필요합니다.

제한사항

  • Gated DeltaNet 레이어를 포함한 Qwen3.5 계열 구조라서 최신 llama.cpp의 해당 아키텍처 지원이 필요합니다. 구버전 빌드에서는 모델을 불러오지 못할 수 있습니다. Ollama와 LM Studio 같은 런타임도 내장 chat template와 호환되는 버전을 사용해야 합니다.
  • 긴 컨텍스트에서는 모델 가중치보다 KV cache가 메모리를 크게 차지합니다. 따라서 낮은 비트 양자화를 선택해도 긴 대화에서는 추가 offload가 필요할 수 있습니다. Q8_0은 12~16GB GPU, BF16은 24GB 이상이 권장됩니다.

벤치마크

벤치마크지표비교
mmlu (CoT, 57 subjects)lm-evaluation-harness score0.751기반 모델 Qwen3.5-9B의 공개 수치 0.546보다 +0.205이며, 이 GGUF 파일 자체의 측정값은 아닙니다.
gsm8k_cotlm-evaluation-harness score0.870기반 모델 Qwen3.5-9B의 공개 수치 0.885보다 −0.015이며, 이 GGUF 파일 자체의 측정값은 아닙니다.

101

Likes

71.6k

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.