본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

AtomicChat/Qwen3.8-Flash-Next-GGUF

텍스트 생성 및 이미지-텍스트 생성125B total / 6B active, 51B n-gram embedding과 4B MTP layer 추가; 실행 섹션에는 177B parameters로 기재262K 컨텍스트qwen-community-1.0

importance matrix 기반 GGUF 양자화로 177B급 모델을 SSD 오프로딩과 llama.cpp에서 실행

학습 방식 · Qwen/Qwen3.8-Flash-Next 원본 가중치를 GGUF로 변환한 뒤 공개 calibration corpus 4,967,044 tokens에 대한 importance matrix를 계산하고, 이를 사용해 여러 비트폭으로 양자화했습니다.

TL;DR

AtomicChat/Qwen3.8-Flash-Next-GGUF는 Qwen/Qwen3.8-Flash-Next 원본 가중치에 공개 calibration corpus와 자체 importance matrix를 적용한 GGUF 양자화 모델입니다. 51B 규모의 n-gram lookup table은 전체를 메모리에 올리지 않고 별도 GGUF shard에서 SSD mmap으로 읽어 64GB M5 Max에서도 vision 입력과 함께 36 tok/s로 실행합니다. 양자화 과정은 attn_gate 활성화가 큰 blocks 0–3과 40–47에 더 많은 비트를 배정해 동일 파일 크기에서 Mean KLD를 0.2277에서 0.0842로 낮췄습니다. 기본 선택지로는 메모리 사용량과 품질의 균형을 맞춘 AD-4.27bpw-Q4_K_M-M64가 권장되지만, 전용 llama.cpp 지원과 --jinja 설정이 필요합니다.

핵심 포인트

  • 원본 Qwen3.8-Flash-Next를 자체 importance matrix로 GGUF 양자화한 파생 모델입니다.
  • n-gram table을 별도 shard에 분리해 64GB M5 Max에서도 SSD mmap으로 실행합니다.
  • attn_gate가 큰 blocks 0–3과 40–47에 높은 비트를 배정해 Mean KLD를 낮췄습니다.
  • AD-4.27bpw-Q4_K_M-M64는 5.00bpw와 비슷한 수치를 17.6GB 작은 파일로 제공합니다.

제한사항

  • GGUF 실행에는 Qwen3.8-Flash-Next를 지원하는 llama.cpp build가 필요하며, 지원이 배포되는 중입니다.
  • 이 저장소의 GGUF quant는 multimodal 원본 중 text path를 대상으로 하며, vision 실행에는 별도 mmproj 파일이 필요합니다.
  • Apple Silicon에서는 n-gram table이 단독 GGUF shard 2에 있어야 하며, mmap on과 -fit off 설정이 필요합니다.

벤치마크

벤치마크지표비교
Mean KLDKLD0.0842AD-4.27bpw-Q4_K_M-M64 자체 측정; AD-3.84bpw-IQ4_XS-M64는 0.2277, AD-5.00bpw-Q5_K_M-M64는 0.0837
Same top-1일치율89.49%AD-4.27bpw-Q4_K_M-M64 자체 측정; AD-3.84bpw는 82.68%, AD-5.00bpw는 89.55%
PPLBF16 perplexity4.0445 ± 0.0216동일 reference·corpus·machine에서 사용한 BF16 기준 모델의 공개 측정값이며 quant 자체 측정값 아님
LiveCodeBench v6score91.9Qwen이 공개한 기반 모델 Qwen/Qwen3.8-Flash-Next 수치이며 이 GGUF quant의 직접 측정값 아님
GPQA Diamondscore91.7Qwen이 공개한 기반 모델 Qwen/Qwen3.8-Flash-Next 수치이며 이 GGUF quant의 직접 측정값 아님
SWE-bench Multilingualscore81.0Qwen이 공개한 기반 모델 Qwen/Qwen3.8-Flash-Next 수치이며 이 GGUF quant의 직접 측정값 아님
CoWorkBenchscore73.9Qwen이 공개한 기반 모델 Qwen/Qwen3.8-Flash-Next 수치이며 이 GGUF quant의 직접 측정값 아님
pp512tokens/s517.9 tok/sApple M5 Max에서 측정
tg128tokens/s36.0 tok/sApple M5 Max에서 측정

이미지 분석

4000 chunks 기준 layer별 attn_gate activation energy를 막대그래프로 나타낸 차트로, blocks 0–3과 40–47의 high-bit band 및 나머지 base precision 구간을 색상으로 구분합니다.
회색 막대의 대부분은 약 500–880 수준이지만, high-bit band에 포함된 40–47 구간은 약 1,000–1,470으로 높고 layer 0도 약 1,400에 이릅니다. 이 분포는 양자화 비트를 모든 layer에 균등하게 배정하기보다 앞·뒤 구간의 attn_gate에 집중하는 recipe를 뒷받침합니다.

71

LIKES

24.8k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.