AtomicChat/Qwen3.8-Flash-Next-GGUF
텍스트 생성 및 이미지-텍스트 생성125B total / 6B active, 51B n-gram embedding과 4B MTP layer 추가; 실행 섹션에는 177B parameters로 기재262K 컨텍스트qwen-community-1.0
importance matrix 기반 GGUF 양자화로 177B급 모델을 SSD 오프로딩과 llama.cpp에서 실행
학습 방식 · Qwen/Qwen3.8-Flash-Next 원본 가중치를 GGUF로 변환한 뒤 공개 calibration corpus 4,967,044 tokens에 대한 importance matrix를 계산하고, 이를 사용해 여러 비트폭으로 양자화했습니다.
TL;DR
AtomicChat/Qwen3.8-Flash-Next-GGUF는 Qwen/Qwen3.8-Flash-Next 원본 가중치에 공개 calibration corpus와 자체 importance matrix를 적용한 GGUF 양자화 모델입니다. 51B 규모의 n-gram lookup table은 전체를 메모리에 올리지 않고 별도 GGUF shard에서 SSD mmap으로 읽어 64GB M5 Max에서도 vision 입력과 함께 36 tok/s로 실행합니다. 양자화 과정은 attn_gate 활성화가 큰 blocks 0–3과 40–47에 더 많은 비트를 배정해 동일 파일 크기에서 Mean KLD를 0.2277에서 0.0842로 낮췄습니다. 기본 선택지로는 메모리 사용량과 품질의 균형을 맞춘 AD-4.27bpw-Q4_K_M-M64가 권장되지만, 전용 llama.cpp 지원과 --jinja 설정이 필요합니다.
핵심 포인트
- 원본 Qwen3.8-Flash-Next를 자체 importance matrix로 GGUF 양자화한 파생 모델입니다.
- n-gram table을 별도 shard에 분리해 64GB M5 Max에서도 SSD mmap으로 실행합니다.
- attn_gate가 큰 blocks 0–3과 40–47에 높은 비트를 배정해 Mean KLD를 낮췄습니다.
- AD-4.27bpw-Q4_K_M-M64는 5.00bpw와 비슷한 수치를 17.6GB 작은 파일로 제공합니다.
제한사항
- GGUF 실행에는 Qwen3.8-Flash-Next를 지원하는 llama.cpp build가 필요하며, 지원이 배포되는 중입니다.
- 이 저장소의 GGUF quant는 multimodal 원본 중 text path를 대상으로 하며, vision 실행에는 별도 mmproj 파일이 필요합니다.
- Apple Silicon에서는 n-gram table이 단독 GGUF shard 2에 있어야 하며, mmap on과 -fit off 설정이 필요합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Mean KLD | KLD | 0.0842 | AD-4.27bpw-Q4_K_M-M64 자체 측정; AD-3.84bpw-IQ4_XS-M64는 0.2277, AD-5.00bpw-Q5_K_M-M64는 0.0837 |
| Same top-1 | 일치율 | 89.49% | AD-4.27bpw-Q4_K_M-M64 자체 측정; AD-3.84bpw는 82.68%, AD-5.00bpw는 89.55% |
| PPL | BF16 perplexity | 4.0445 ± 0.0216 | 동일 reference·corpus·machine에서 사용한 BF16 기준 모델의 공개 측정값이며 quant 자체 측정값 아님 |
| LiveCodeBench v6 | score | 91.9 | Qwen이 공개한 기반 모델 Qwen/Qwen3.8-Flash-Next 수치이며 이 GGUF quant의 직접 측정값 아님 |
| GPQA Diamond | score | 91.7 | Qwen이 공개한 기반 모델 Qwen/Qwen3.8-Flash-Next 수치이며 이 GGUF quant의 직접 측정값 아님 |
| SWE-bench Multilingual | score | 81.0 | Qwen이 공개한 기반 모델 Qwen/Qwen3.8-Flash-Next 수치이며 이 GGUF quant의 직접 측정값 아님 |
| CoWorkBench | score | 73.9 | Qwen이 공개한 기반 모델 Qwen/Qwen3.8-Flash-Next 수치이며 이 GGUF quant의 직접 측정값 아님 |
| pp512 | tokens/s | 517.9 tok/s | Apple M5 Max에서 측정 |
| tg128 | tokens/s | 36.0 tok/s | Apple M5 Max에서 측정 |
이미지 분석

71
LIKES
24.8k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.