본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

AtomicChat/Qwen3.8-27B-GGUF

Qwen3.8-27B를 GGUF로 양자화해 text와 image를 함께 처리하는 로컬 멀티모달 추론27B262K 컨텍스트

중요 텐서에 비트를 더 배분한 Qwen3.8-27B GGUF 양자화 모델입니다.

학습 방식 · Qwen/Qwen3.8-27B 원본 가중치를 기반으로 AtomicChat의 공개 calibration corpus와 importance matrix를 사용해 GGUF 양자화했으며, `AD-` 레이아웃에서 텐서별 정밀도를 차등 배분합니다.

TL;DR

이 모델은 Qwen/Qwen3.8-27B 원본 가중치를 AtomicChat의 importance matrix로 차등 양자화한 GGUF 배포본이며, `AD-` 접두사는 FFN과 attention gate 같은 중요 텐서 그룹에 비트를 더 배분한 Atomic Dynamic 레이아웃을 뜻합니다. 12.1GB AD-IQ3_XXS부터 28.9GB Q8_0까지 파일을 고를 수 있고, 20.2GB AD-Q5_K_M은 BF16 기준 KL divergence 0.00419와 top-1 agreement 97.34%를 기록했습니다. llama.cpp에서는 GGUF와 별도 vision projector를 연결해 이미지도 읽으며, AD-IQ3_S 이상은 gothic calligraphy 손글씨를 줄바꿈까지 정확히 전사했습니다. 다만 컨텍스트가 늘면 attention cache가 8k에서 2GB, 32k에서 8GB를 추가로 차지하므로 파일 크기와 실행 메모리를 함께 계산해야 합니다.

핵심 포인트

  • Qwen/Qwen3.8-27B 원본 가중치에 자체 importance matrix를 적용한 GGUF 양자화 모델로, Atomic Dynamic 레이아웃을 사용합니다.
  • 동일한 파일 크기에서도 중요도가 높은 FFN·attention gate·state output에 더 많은 비트를 배분해 예측 손실을 줄입니다.
  • 12.1GB AD-IQ3_XXS부터 28.9GB Q8_0까지 선택할 수 있어 GPU 메모리와 컨텍스트 길이에 맞춰 배포할 수 있습니다.
  • 별도 vision projector와 llama.cpp를 함께 사용하면 이미지 입력과 필기 텍스트 전사를 처리할 수 있습니다.

제한사항

  • 양자화 파일만으로는 이미지 입력이 동작하지 않으며, `mmproj-Qwen3.8-27B-F16.gguf` 또는 BF16 vision projector를 별도로 받아야 합니다.
  • 파일 메모리 외에 attention cache가 필요하며, 8k 컨텍스트에서 2GB, 32k 컨텍스트에서 8GB를 추가로 예산에 넣어야 합니다.
  • 최근 `qwen35` 아키텍처 지원이 포함된 llama.cpp가 필요하고, 이미지 처리에서는 `--image-min-tokens 1024` 설정이 사실상 필수입니다.

벤치마크

벤치마크지표비교
KL divergence vs BF16 referenceKL divergenceAD-Q8_0 0.00064; AD-Q6_K 0.00107; AD-Q5_K_M 0.00419; AD-Q4_K_M 0.01126; AD-IQ3_XXS 0.06972; AD-IQ1_M 0.34212동일한 BF16 원본과 held-out text에서 측정한 수치이며, 20.2GB AD-Q5_K_M은 unsloth UD-Q5_K_XL의 0.00437보다 낮고 16.5GB AD-IQ4_XS는 unsloth Q4_K_S의 0.01707보다 낮습니다.
Top-1 agreement vs BF16 referencetop-1 agreementQ8_0 98.92%; AD-Q6_K 98.67%; AD-Q5_K_M 97.34%; AD-Q4_K_M 95.59%; AD-IQ3_XXS 89.13%; AD-IQ1_M 76.34%원본 BF16 모델이 선택한 다음 토큰과 일치하는 비율이며, 수치 자체는 AtomicChat 양자화 파일을 BF16 기준으로 측정한 결과입니다.
llama.cpp generation speedgeneration speedAD-Q4_K_M, 2×RTX 5090 full offload에서 8k context 77 t/s, 32k context 72 t/s같은 설정에서 prompt 처리 속도는 8k context 363 t/s, 32k context 5244 t/s로 기록됐습니다.
Vision transcriptionexact transcriptionAD-IQ3_S 이상 모든 파일이 gothic calligraphy 이미지의 문장을 줄바꿈까지 정확히 전사README의 `demo.jpg` 테스트에 대한 결과이며, 일반 사진이 아닌 손글씨 이미지를 사용한 양자화 내구성 사례입니다.

이미지 분석

Qwen3.8 27B의 파일 크기별 Mean KL divergence를 BF16 기준으로 비교한 로그 스케일 그래프입니다.
그래프는 AtomicChat의 AD 양자화 계열이 8.5GB부터 28.9GB까지 파일 크기가 커질수록 BF16과의 KL divergence를 낮추는 흐름을 보여줍니다. 파란색 AtomicChat 점과 선은 여러 구간에서 다른 GGUF 빌드보다 낮은 divergence에 위치하며, README의 동일 기준 비교 수치를 시각적으로 뒷받침합니다.
gothic 또는 Blackletter 서체로 작성된 손글씨 문장과 장식 테두리가 담긴 `demo.jpg` 테스트 이미지입니다.
이미지에는 손으로 만드는 일이 평온함을 주고 다른 사람의 창작을 자극한다는 영어 문장이 줄바꿈과 함께 적혀 있으며, 큰 파란색 이니셜과 식물성 장식 테두리가 주변을 감쌉니다. README는 이 이미지를 양자화 모델의 vision 전사 테스트에 사용했고, AD-IQ3_S 이상 파일이 문장을 줄바꿈까지 정확히 전사했다고 기록합니다.
llama.cpp에서 Qwen3.8-27B GGUF와 vision projector로 손글씨 이미지를 전사한 CLI 결과 화면입니다.
터미널 명령은 `llama-mtmd-cli`에 양자화 모델과 `mmproj-Qwen3.8-27B-F16.gguf`를 연결하고 `--image-min-tokens 1024`를 지정해 이미지 전사와 장식 묘사를 요청하는 과정을 담고 있습니다. 출력에는 이미지 속 문장을 줄 단위로 전사한 뒤 gothic 또는 Blackletter 서체, 파란색 이니셜, 식물성 테두리와 서명을 묘사한 결과가 표시되어 멀티모달 실행 경로와 응답 형태를 확인할 수 있습니다.

94

Likes

57.6k

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.