TL;DR
작성자는 codeparrot/github-code-clean, EleutherAI/proof-pile-2, allenai/peS2o를 섞은 데이터로 Qwen3.8-27B 양자화판 24개를 같은 계산 경로에서 비교했습니다. 4-bit와 8-bit 사이에는 큰 KLD 격차가 있었고, 같은 11.7~11.8GiB 크기의 4-bit 모델도 KLD가 0.01364에서 0.02976까지 달랐습니다. group size 32는 일부 모듈을 BF16으로 남긴 group size 128보다 낮은 KLD를 기록했으며, 선택적 BF16은 파일 크기를 크게 늘렸습니다. 양자화 손상은 모든 모델에서 문맥 초반 500토큰에 집중됐고, lm_head·embed_tokens·linear_attn 양자화는 이 테스트 성능에 영향을 주지 않았습니다.
실용적 조언
- 4-bit 양자화판을 고를 때 파일 크기만 비교하지 말고 KLD나 별도의 코딩·STEM 평가 수치를 함께 확인해야 합니다. 글에서는 비슷한 11.7~11.8GiB 크기에서도 KLD가 0.01364와 0.02976 사이로 달랐습니다. 저장 공간이 같아도 calibration data와 rounding algorithm에 따라 결과가 달라질 수 있습니다.
- 양자화 설정을 비교할 때 bit 수와 함께 group size를 기록해야 합니다. 이 비교에서는 group size 32가 group size 128에 일부 BF16 모듈을 남긴 구성보다 더 낮은 KLD를 기록했습니다. 세밀한 group size에 선택적 BF16을 더하면 파일이 커져 6-bit 모델과 비슷한 비용이 될 수 있습니다.
- VRAM 예산을 계산할 때 Transformer 본체 가중치뿐 아니라 전체 체크포인트 크기도 확인해야 합니다. 작성자는 MTP가 성능에는 영향을 주지 않지만 모든 가중치를 VRAM에 적재해야 하므로 파일 크기 자체는 실용적인 참고값이라고 덧붙였습니다. 실제 선택에서는 성능 지표와 적재 가능한 모델 크기를 별도로 비교하는 편이 적절합니다.
섹션별 상세
이미지 분석

가로축은 임베딩과 lm_head, MTP, vision tower를 제외한 Transformer 본체 가중치 크기이며, 세로축은 BF16 기준과의 KLD를 로그 스케일로 나타냅니다. 4-bit 점들은 비슷한 크기에서도 KLD가 크게 갈리고, 8-bit 점들은 더 낮은 KLD 영역에 모여 있어 파일 크기와 양자화 손상이 일대일로 대응하지 않음을 보여줍니다.
Qwen3.8-27B 양자화 체크포인트의 Transformer 본체 크기와 BF16 기준 KLD를 비교한 산점도입니다.

가로축이 전체 체크포인트 크기를 사용하므로 MTP 같은 구성 요소가 저장 공간에 미치는 영향까지 반영됩니다. 표의 모델별 크기와 KLD를 함께 보면 더 큰 파일이 항상 낮은 KLD를 보장하지 않으며, 양자화 방식과 모듈별 설정을 별도로 확인해야 한다는 글의 결론과 연결됩니다.
전체 safetensors 체크포인트 크기와 BF16 기준 KLD를 비교하고 모델별 순위와 수치를 나열한 산점도입니다.
용어 해설
- Kullback–Leibler divergence(KLD)
- — KLD는 양자화 모델의 출력 분포가 BF16 기준 모델의 출력 분포에서 얼마나 벗어났는지 측정하는 지표입니다. 값이 낮을수록 양자화로 인한 분포 변화가 작다는 뜻입니다.
- 역양자화(Dequantization)
- — Dequantization은 저장된 저비트 가중치를 추론 과정에서 BF16 같은 계산 형식으로 변환하는 단계입니다. 이 글에서는 모든 양자화 형식을 같은 커널과 계산 경로에서 비교하기 위해 사용했습니다.
- 그룹 크기(group size)
- — group size는 하나의 양자화 스케일과 관련 파라미터를 공유하는 가중치 묶음의 크기입니다. 글의 비교에서는 group size 32가 group size 128보다 낮은 KLD를 기록하는 경향이 나타났습니다.
- BF16
- — BF16은 16비트 부동소수점 형식으로, 이 글에서는 양자화 가중치를 복원해 동일한 계산 경로에서 실행하는 기준 형식으로 사용했습니다. 일부 모듈을 BF16으로 남기는 선택적 보존 효과도 비교했습니다.
- Multi-Token Prediction(MTP)
- — MTP는 한 번에 여러 토큰을 예측하도록 추가 모듈을 사용하는 방식입니다. 글에서는 MTP가 체크포인트 파일 크기에는 영향을 주지만 해당 성능 측정에는 영향이 없어 파일 크기만으로 모델을 비교하기 어렵다고 설명했습니다.
언급된 도구
INT5-7 가중치를 사용할 수 있는 추론 엔진으로 언급됐습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.