본문으로 건너뛰기

Qwen 3.5 4B에서 확인한 Tensor-Level Allocation

QLAB이 Qwen 3.5 4B의 IQ2_XS 정밀도 배분을 바꿔 reasoning을 16.67% 높였다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 Qwen 3.5 4B의 IQ2_XS 양자화에서 tensor별 정밀도 배분을 바꿔 stock imatrix의 reasoning 점수 46.875를 54.688로 높였습니다. 범주별 corpus로 imatrix를 만들고 손상이 큰 tensor에 정밀도를 재분배했으며, 모델 크기 증가는 0.412%였습니다. 11개 평가 영역 중 8개가 개선됐지만 knowledge QA, structured output, coherence에서는 회귀가 발생했습니다. 이는 Fine-tuning이나 weight update 없이 양자화 예산의 사용 위치만 바꿔 Gemma 계열 밖의 Qwen에서도 능력별 보존 효과를 재현한 결과입니다.

섹션별 상세

01
작성자는 Gemma 계열에서 쓰던 tensor-level allocation을 Qwen 3.5 4B의 IQ2_XS 양자화에 옮겼습니다. 범주별 corpus로 imatrix를 만들고 손상을 측정한 뒤, 같은 바이트 예산 안에서 tensor별 정밀도를 재분배하는 순서입니다. 그 결과 stock IQ2_XS와 같은 imatrix의 reasoning 점수 46.875가 QLAB allocation에서 54.688로 올라 7.812 percentage points, 상대 기준 16.67% 개선됐고 모델 크기 증가는 0.412%였습니다.
02
이 실험의 변화는 Fine-tuning, LoRA, pruning 또는 weight update가 아니라 정밀도를 소비하는 위치의 변경으로 한정됐습니다. QLAB allocation은 reasoning에만 영향을 준 것이 아니라 11개 평가 영역 중 8개에서 개선을 기록했지만, knowledge QA, structured output, coherence에서는 회귀가 나타났습니다. 따라서 결과는 범용 모델 개선이라기보다 특정 능력을 보존하도록 양자화 예산을 배분하는 방법이 Qwen 계열에도 이전됐다는 근거로 제시됐습니다.
03
제공된 비교에서 IQ2_XS champion은 BF16 대비 reasoning 70.0%, math 40.5%, summarization extraction 65.9%를 유지했고 instruction following 88.2%, context 92.7%, stability 91.8%를 기록했습니다. 반면 coding은 10.5%, knowledge QA는 59.5%, structured output은 73.0%였으며 coherence는 82.7%였습니다. 처리량 측정에서는 stock imatrix가 prompt 373.5 tok/s와 generation 222.4 tok/s, champion이 prompt 354.3 tok/s와 generation 212.3 tok/s를 기록해 allocation 변경 뒤 속도 수치가 더 낮았습니다.

이미지 분석

Qwen 3.5 4B의 11개 능력 영역에서 BF16, IQ2_XS stock imatrix, QLAB champion의 절대 점수를 비교한 가로 막대그래프입니다.
Chart

QLAB champion은 reasoning에서 stock imatrix의 46.875 수준보다 높은 약 54.7을 기록하고, summarization extraction과 instruction following에서도 stock보다 긴 막대를 보입니다. 반면 knowledge QA, structured output, coherence에서는 stock보다 낮아 특정 능력의 회복과 다른 영역의 회귀가 함께 나타나며, 이는 정밀도 배분이 범용 개선이 아니라 능력 간 예산 교환으로 작동했음을 뒷받침합니다.

Qwen 3.5 4B의 11개 능력 영역에서 BF16, IQ2_XS stock imatrix, QLAB champion의 절대 점수를 비교한 가로 막대그래프입니다.

IQ2_XS champion이 BF16 대비 각 평가 영역에서 유지한 성능 비율을 나타낸 가로 막대그래프입니다.
Chart

가장 높은 유지율은 context 92.7%와 stability 91.8%이며, instruction following은 88.2%, general fidelity는 84.4%, coherence는 82.7%입니다. math는 40.5%, coding은 10.5%, knowledge QA는 59.5%로 낮아 영역별 양자화 손상 편차가 크고, 95% retention과 BF16 parity 기준선에 도달한 영역은 없습니다.

IQ2_XS champion이 BF16 대비 각 평가 영역에서 유지한 성능 비율을 나타낸 가로 막대그래프입니다.

BF16 source, IQ2_XS stock imatrix, IQ2_XS champion의 prompt 및 generation 처리량을 비교한 막대그래프입니다.
Chart

stock imatrix는 prompt 373.5 tok/s와 generation 222.4 tok/s를 기록했고, champion은 각각 354.3 tok/s와 212.3 tok/s였습니다. champion은 stock보다 reasoning 등 일부 점수를 높였지만 처리량은 prompt와 generation 모두 낮아져, 정밀도 배분 효과를 정확도와 속도의 교환 관계로 평가해야 함을 나타냅니다.

BF16 source, IQ2_XS stock imatrix, IQ2_XS champion의 prompt 및 generation 처리량을 비교한 막대그래프입니다.

용어 해설

Tensor-Level Allocation
양자화 예산을 모든 tensor에 동일하게 배분하지 않고, 평가하려는 능력에서 손상이 큰 tensor에 더 높은 정밀도를 배정하는 방식입니다. 전체 모델의 가중치 값을 학습하거나 바꾸지 않고 정밀도가 사용되는 위치만 재분배해 제한된 바이트 예산 안에서 특정 능력의 보존을 노립니다.
imatrix
모델의 양자화 손상을 측정하고 보정하기 위해 범주별 corpus를 사용해 만든 중요도 행렬입니다. 이 글에서는 reasoning 같은 평가 범주에 맞는 데이터를 넣어 손상을 측정한 뒤, 같은 imatrix를 유지하면서 tensor별 정밀도 배분을 바꾸는 데 사용했습니다.
양자화(Quantization)
모델 가중치의 표현 정밀도를 낮춰 저장 공간과 추론 비용을 줄이는 처리입니다. 이 실험은 Qwen 3.5 4B를 IQ2_XS 예산으로 표현하면서, 전체 바이트 수를 거의 유지한 채 어떤 tensor에 정밀도를 쓸지 조정해 능력별 성능 변화를 비교했습니다.
보류 데이터 평가(held-out evaluation)
정밀도 배분을 결정할 때 직접 사용하지 않은 평가 데이터를 이용해 모델 능력의 보존 정도를 확인하는 절차입니다. 글에서는 stock imatrix와 QLAB allocation을 held-out reasoning 점수로 비교해 46.875에서 54.688로 상승한 결과를 기록했습니다.
바이트 예산(byte budget)
양자화 모델이 차지할 수 있도록 정해 둔 저장 용량 한도입니다. QLAB allocation은 stock 모델의 1,630,594,336바이트에서 1,637,318,816바이트로 늘어나 전체 차이가 0.412%에 그쳤으며, 이 범위 안에서 tensor별 정밀도 배분을 조정했습니다.

언급된 도구

QLAB추천

원하는 능력을 선택하고 tensor별 정밀도 배분을 자동화해 목표 바이트 예산 안에서 양자화 모델을 생성하는 도구입니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 22.수집 2026. 08. 23.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.