AtomicChat/Qwen3.8-27B-GGUF
Qwen3.8-27B를 GGUF로 양자화해 text와 image를 함께 처리하는 로컬 멀티모달 추론27B262K 컨텍스트
중요 텐서에 비트를 더 배분한 Qwen3.8-27B GGUF 양자화 모델입니다.
학습 방식 · Qwen/Qwen3.8-27B 원본 가중치를 기반으로 AtomicChat의 공개 calibration corpus와 importance matrix를 사용해 GGUF 양자화했으며, `AD-` 레이아웃에서 텐서별 정밀도를 차등 배분합니다.
TL;DR
이 모델은 Qwen/Qwen3.8-27B 원본 가중치를 AtomicChat의 importance matrix로 차등 양자화한 GGUF 배포본이며, `AD-` 접두사는 FFN과 attention gate 같은 중요 텐서 그룹에 비트를 더 배분한 Atomic Dynamic 레이아웃을 뜻합니다. 12.1GB AD-IQ3_XXS부터 28.9GB Q8_0까지 파일을 고를 수 있고, 20.2GB AD-Q5_K_M은 BF16 기준 KL divergence 0.00419와 top-1 agreement 97.34%를 기록했습니다. llama.cpp에서는 GGUF와 별도 vision projector를 연결해 이미지도 읽으며, AD-IQ3_S 이상은 gothic calligraphy 손글씨를 줄바꿈까지 정확히 전사했습니다. 다만 컨텍스트가 늘면 attention cache가 8k에서 2GB, 32k에서 8GB를 추가로 차지하므로 파일 크기와 실행 메모리를 함께 계산해야 합니다.
핵심 포인트
- Qwen/Qwen3.8-27B 원본 가중치에 자체 importance matrix를 적용한 GGUF 양자화 모델로, Atomic Dynamic 레이아웃을 사용합니다.
- 동일한 파일 크기에서도 중요도가 높은 FFN·attention gate·state output에 더 많은 비트를 배분해 예측 손실을 줄입니다.
- 12.1GB AD-IQ3_XXS부터 28.9GB Q8_0까지 선택할 수 있어 GPU 메모리와 컨텍스트 길이에 맞춰 배포할 수 있습니다.
- 별도 vision projector와 llama.cpp를 함께 사용하면 이미지 입력과 필기 텍스트 전사를 처리할 수 있습니다.
제한사항
- 양자화 파일만으로는 이미지 입력이 동작하지 않으며, `mmproj-Qwen3.8-27B-F16.gguf` 또는 BF16 vision projector를 별도로 받아야 합니다.
- 파일 메모리 외에 attention cache가 필요하며, 8k 컨텍스트에서 2GB, 32k 컨텍스트에서 8GB를 추가로 예산에 넣어야 합니다.
- 최근 `qwen35` 아키텍처 지원이 포함된 llama.cpp가 필요하고, 이미지 처리에서는 `--image-min-tokens 1024` 설정이 사실상 필수입니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| KL divergence vs BF16 reference | KL divergence | AD-Q8_0 0.00064; AD-Q6_K 0.00107; AD-Q5_K_M 0.00419; AD-Q4_K_M 0.01126; AD-IQ3_XXS 0.06972; AD-IQ1_M 0.34212 | 동일한 BF16 원본과 held-out text에서 측정한 수치이며, 20.2GB AD-Q5_K_M은 unsloth UD-Q5_K_XL의 0.00437보다 낮고 16.5GB AD-IQ4_XS는 unsloth Q4_K_S의 0.01707보다 낮습니다. |
| Top-1 agreement vs BF16 reference | top-1 agreement | Q8_0 98.92%; AD-Q6_K 98.67%; AD-Q5_K_M 97.34%; AD-Q4_K_M 95.59%; AD-IQ3_XXS 89.13%; AD-IQ1_M 76.34% | 원본 BF16 모델이 선택한 다음 토큰과 일치하는 비율이며, 수치 자체는 AtomicChat 양자화 파일을 BF16 기준으로 측정한 결과입니다. |
| llama.cpp generation speed | generation speed | AD-Q4_K_M, 2×RTX 5090 full offload에서 8k context 77 t/s, 32k context 72 t/s | 같은 설정에서 prompt 처리 속도는 8k context 363 t/s, 32k context 5244 t/s로 기록됐습니다. |
| Vision transcription | exact transcription | AD-IQ3_S 이상 모든 파일이 gothic calligraphy 이미지의 문장을 줄바꿈까지 정확히 전사 | README의 `demo.jpg` 테스트에 대한 결과이며, 일반 사진이 아닌 손글씨 이미지를 사용한 양자화 내구성 사례입니다. |
이미지 분석



94
Likes
57.6k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.