본문으로 건너뛰기

iq-quantization

IQ 양자화

IQ 양자화는 모델 가중치를 낮은 비트 형식으로 압축해 메모리 사용량을 줄이는 방식입니다. 이 글에서는 IQ1부터 IQ4까지 여러 형식을 CPU의 대규모 배치 처리에 적용하고 속도와 PPL 변화를 비교합니다.