본문으로 건너뛰기
r/LocalLLaMA조회 2

Qwen3.8-27B 양자화판 성능 비교

Qwen3.8-27B 양자화판 24개를 비교한 결과 4-bit 모델의 KLD가 파일 크기보다 calibration과 group size에 크게 좌우됐다

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 codeparrot/github-code-clean, EleutherAI/proof-pile-2, allenai/peS2o를 섞은 데이터로 Qwen3.8-27B 양자화판 24개를 같은 계산 경로에서 비교했습니다. 4-bit와 8-bit 사이에는 큰 KLD 격차가 있었고, 같은 11.7~11.8GiB 크기의 4-bit 모델도 KLD가 0.01364에서 0.02976까지 달랐습니다. group size 32는 일부 모듈을 BF16으로 남긴 group size 128보다 낮은 KLD를 기록했으며, 선택적 BF16은 파일 크기를 크게 늘렸습니다. 양자화 손상은 모든 모델에서 문맥 초반 500토큰에 집중됐고, lm_head·embed_tokens·linear_attn 양자화는 이 테스트 성능에 영향을 주지 않았습니다.

실용적 조언

  • 4-bit 양자화판을 고를 때 파일 크기만 비교하지 말고 KLD나 별도의 코딩·STEM 평가 수치를 함께 확인해야 합니다. 글에서는 비슷한 11.7~11.8GiB 크기에서도 KLD가 0.01364와 0.02976 사이로 달랐습니다. 저장 공간이 같아도 calibration data와 rounding algorithm에 따라 결과가 달라질 수 있습니다.
  • 양자화 설정을 비교할 때 bit 수와 함께 group size를 기록해야 합니다. 이 비교에서는 group size 32가 group size 128에 일부 BF16 모듈을 남긴 구성보다 더 낮은 KLD를 기록했습니다. 세밀한 group size에 선택적 BF16을 더하면 파일이 커져 6-bit 모델과 비슷한 비용이 될 수 있습니다.
  • VRAM 예산을 계산할 때 Transformer 본체 가중치뿐 아니라 전체 체크포인트 크기도 확인해야 합니다. 작성자는 MTP가 성능에는 영향을 주지 않지만 모든 가중치를 VRAM에 적재해야 하므로 파일 크기 자체는 실용적인 참고값이라고 덧붙였습니다. 실제 선택에서는 성능 지표와 적재 가능한 모델 크기를 별도로 비교하는 편이 적절합니다.

섹션별 상세

01
작성자는 Qwen3.8-27B의 양자화판을 비교하기 위해 codeparrot/github-code-clean, EleutherAI/proof-pile-2, allenai/peS2o를 같은 비율로 섞었습니다. 8,192토큰 시퀀스 24개와 32,768토큰 시퀀스 12개를 사용했고, 코드 데이터에서는 minified 코드와 비허용 라이선스를 제외했습니다. 긴 문맥에서 많은 토큰을 생성하는 모델 특성을 반영한 평가 구성입니다.
02
8-bit와 4-bit 사이의 KLD 격차가 크게 나타났습니다. 최상의 4-bit 체크포인트는 0.00835, 최악의 8-bit 체크포인트는 0.00071이었으며, 두 수치는 BF16 기준 출력 분포와의 차이를 나타냅니다. 따라서 저장 공간을 줄이는 4-bit 선택이 모든 모델에서 비슷한 품질을 보장하지 않는다는 결론으로 이어집니다.
03
같은 11.7~11.8GiB 수준의 Transformer 가중치를 가진 4-bit 체크포인트 여섯 개도 KLD가 0.01364에서 0.02976까지 벌어졌습니다. 이들은 모두 group size 128을 사용하고 400~496개 모듈을 양자화했지만 결과가 달랐으며, 작성자는 calibration data와 rounding algorithm의 영향이 크다고 추정했습니다. 파일 크기만 보고 4-bit 양자화판을 고르면 출력 손상 정도를 놓칠 수 있다는 의미입니다.
04
group size 32를 사용한 체크포인트는 일부 모듈을 BF16으로 남긴 group size 128 체크포인트보다 더 낮은 KLD를 기록했습니다. 선택적 BF16 보존은 이미 세밀한 group size를 적용한 뒤 추가할 때만 효과가 있었고, 그 경우 파일 크기가 6-bit 모델에 가까워졌습니다. 양자화 비트 수뿐 아니라 그룹 단위 설정과 BF16 보존 범위를 함께 봐야 하는 이유입니다.
05
양자화 손상은 문맥 전체에 균등하게 퍼지지 않고 시작 부분의 500토큰에서 특히 크게 나타났습니다. 이 패턴은 비교한 24개 모델 모두에서 관찰됐고, 그래프의 세로축은 BF16 기준과의 KLD를 로그 스케일로 표시했습니다. 긴 입력을 처리할 때 초반 토큰의 분포 변화가 이후 출력에 어떤 영향을 주는지는 추가 평가가 필요한 부분입니다.

이미지 분석

Qwen3.8-27B 양자화 체크포인트의 Transformer 본체 크기와 BF16 기준 KLD를 비교한 산점도입니다.
Chart

가로축은 임베딩과 lm_head, MTP, vision tower를 제외한 Transformer 본체 가중치 크기이며, 세로축은 BF16 기준과의 KLD를 로그 스케일로 나타냅니다. 4-bit 점들은 비슷한 크기에서도 KLD가 크게 갈리고, 8-bit 점들은 더 낮은 KLD 영역에 모여 있어 파일 크기와 양자화 손상이 일대일로 대응하지 않음을 보여줍니다.

Qwen3.8-27B 양자화 체크포인트의 Transformer 본체 크기와 BF16 기준 KLD를 비교한 산점도입니다.

전체 safetensors 체크포인트 크기와 BF16 기준 KLD를 비교하고 모델별 순위와 수치를 나열한 산점도입니다.
Chart

가로축이 전체 체크포인트 크기를 사용하므로 MTP 같은 구성 요소가 저장 공간에 미치는 영향까지 반영됩니다. 표의 모델별 크기와 KLD를 함께 보면 더 큰 파일이 항상 낮은 KLD를 보장하지 않으며, 양자화 방식과 모듈별 설정을 별도로 확인해야 한다는 글의 결론과 연결됩니다.

전체 safetensors 체크포인트 크기와 BF16 기준 KLD를 비교하고 모델별 순위와 수치를 나열한 산점도입니다.

용어 해설

Kullback–Leibler divergence(KLD)
KLD는 양자화 모델의 출력 분포가 BF16 기준 모델의 출력 분포에서 얼마나 벗어났는지 측정하는 지표입니다. 값이 낮을수록 양자화로 인한 분포 변화가 작다는 뜻입니다.
역양자화(Dequantization)
Dequantization은 저장된 저비트 가중치를 추론 과정에서 BF16 같은 계산 형식으로 변환하는 단계입니다. 이 글에서는 모든 양자화 형식을 같은 커널과 계산 경로에서 비교하기 위해 사용했습니다.
그룹 크기(group size)
group size는 하나의 양자화 스케일과 관련 파라미터를 공유하는 가중치 묶음의 크기입니다. 글의 비교에서는 group size 32가 group size 128보다 낮은 KLD를 기록하는 경향이 나타났습니다.
BF16
BF16은 16비트 부동소수점 형식으로, 이 글에서는 양자화 가중치를 복원해 동일한 계산 경로에서 실행하는 기준 형식으로 사용했습니다. 일부 모듈을 BF16으로 남기는 선택적 보존 효과도 비교했습니다.
Multi-Token Prediction(MTP)
MTP는 한 번에 여러 토큰을 예측하도록 추가 모듈을 사용하는 방식입니다. 글에서는 MTP가 체크포인트 파일 크기에는 영향을 주지만 해당 성능 측정에는 영향이 없어 파일 크기만으로 모델을 비교하기 어렵다고 설명했습니다.

언급된 도구

vLLM중립

INT5-7 가중치를 사용할 수 있는 추론 엔진으로 언급됐습니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 23.수집 2026. 08. 23.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.