TL;DR
작성자는 Qwen 3.5 4B의 IQ2_XS 양자화에서 tensor별 정밀도 배분을 바꿔 stock imatrix의 reasoning 점수 46.875를 54.688로 높였습니다. 범주별 corpus로 imatrix를 만들고 손상이 큰 tensor에 정밀도를 재분배했으며, 모델 크기 증가는 0.412%였습니다. 11개 평가 영역 중 8개가 개선됐지만 knowledge QA, structured output, coherence에서는 회귀가 발생했습니다. 이는 Fine-tuning이나 weight update 없이 양자화 예산의 사용 위치만 바꿔 Gemma 계열 밖의 Qwen에서도 능력별 보존 효과를 재현한 결과입니다.
섹션별 상세
이미지 분석

QLAB champion은 reasoning에서 stock imatrix의 46.875 수준보다 높은 약 54.7을 기록하고, summarization extraction과 instruction following에서도 stock보다 긴 막대를 보입니다. 반면 knowledge QA, structured output, coherence에서는 stock보다 낮아 특정 능력의 회복과 다른 영역의 회귀가 함께 나타나며, 이는 정밀도 배분이 범용 개선이 아니라 능력 간 예산 교환으로 작동했음을 뒷받침합니다.
Qwen 3.5 4B의 11개 능력 영역에서 BF16, IQ2_XS stock imatrix, QLAB champion의 절대 점수를 비교한 가로 막대그래프입니다.

가장 높은 유지율은 context 92.7%와 stability 91.8%이며, instruction following은 88.2%, general fidelity는 84.4%, coherence는 82.7%입니다. math는 40.5%, coding은 10.5%, knowledge QA는 59.5%로 낮아 영역별 양자화 손상 편차가 크고, 95% retention과 BF16 parity 기준선에 도달한 영역은 없습니다.
IQ2_XS champion이 BF16 대비 각 평가 영역에서 유지한 성능 비율을 나타낸 가로 막대그래프입니다.

stock imatrix는 prompt 373.5 tok/s와 generation 222.4 tok/s를 기록했고, champion은 각각 354.3 tok/s와 212.3 tok/s였습니다. champion은 stock보다 reasoning 등 일부 점수를 높였지만 처리량은 prompt와 generation 모두 낮아져, 정밀도 배분 효과를 정확도와 속도의 교환 관계로 평가해야 함을 나타냅니다.
BF16 source, IQ2_XS stock imatrix, IQ2_XS champion의 prompt 및 generation 처리량을 비교한 막대그래프입니다.
용어 해설
- Tensor-Level Allocation
- — 양자화 예산을 모든 tensor에 동일하게 배분하지 않고, 평가하려는 능력에서 손상이 큰 tensor에 더 높은 정밀도를 배정하는 방식입니다. 전체 모델의 가중치 값을 학습하거나 바꾸지 않고 정밀도가 사용되는 위치만 재분배해 제한된 바이트 예산 안에서 특정 능력의 보존을 노립니다.
- imatrix
- — 모델의 양자화 손상을 측정하고 보정하기 위해 범주별 corpus를 사용해 만든 중요도 행렬입니다. 이 글에서는 reasoning 같은 평가 범주에 맞는 데이터를 넣어 손상을 측정한 뒤, 같은 imatrix를 유지하면서 tensor별 정밀도 배분을 바꾸는 데 사용했습니다.
- 양자화(Quantization)
- — 모델 가중치의 표현 정밀도를 낮춰 저장 공간과 추론 비용을 줄이는 처리입니다. 이 실험은 Qwen 3.5 4B를 IQ2_XS 예산으로 표현하면서, 전체 바이트 수를 거의 유지한 채 어떤 tensor에 정밀도를 쓸지 조정해 능력별 성능 변화를 비교했습니다.
- 보류 데이터 평가(held-out evaluation)
- — 정밀도 배분을 결정할 때 직접 사용하지 않은 평가 데이터를 이용해 모델 능력의 보존 정도를 확인하는 절차입니다. 글에서는 stock imatrix와 QLAB allocation을 held-out reasoning 점수로 비교해 46.875에서 54.688로 상승한 결과를 기록했습니다.
- 바이트 예산(byte budget)
- — 양자화 모델이 차지할 수 있도록 정해 둔 저장 용량 한도입니다. QLAB allocation은 stock 모델의 1,630,594,336바이트에서 1,637,318,816바이트로 늘어나 전체 차이가 0.412%에 그쳤으며, 이 범위 안에서 tensor별 정밀도 배분을 조정했습니다.
언급된 도구
원하는 능력을 선택하고 tensor별 정밀도 배분을 자동화해 목표 바이트 예산 안에서 양자화 모델을 생성하는 도구입니다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.