gptq-int4
GPTQ 4비트 양자화
모델 가중치를 4비트 정수로 압축해 메모리 사용량과 연산 비용을 줄이는 양자화 방식이다. 이 글에서는 모델 자체 hidden states로 lm_head와 MTP module을 보정했으며, PPL은 0.6% 증가했지만 GSM8K와 acceptance는 유지되고 단계당 1.8ms가 줄었다.
GPTQ 4비트 양자화
모델 가중치를 4비트 정수로 압축해 메모리 사용량과 연산 비용을 줄이는 양자화 방식이다. 이 글에서는 모델 자체 hidden states로 lm_head와 MTP module을 보정했으며, PPL은 0.6% 증가했지만 GSM8K와 acceptance는 유지되고 단계당 1.8ms가 줄었다.