quantization-awq-int4
양자화(AWQ·GPTQ·INT4)
양자화는 모델 가중치와 활성화를 낮은 비트폭으로 표현해 메모리와 캐시 요구량을 줄이는 기술입니다. AWQ나 GPTQ 같은 방법은 정밀도 저하를 최소화하면서 FP16 대비 메모리 사용을 크게 낮추고, INT4는 메모리 압박 완화를 위해 주로 사용되는 레버입니다. 품질 손실이 허용 범위를 벗어나면 FP16 또는 FP8을 기본으로 유지하는 결정 규칙이 권장됩니다.
양자화(AWQ·GPTQ·INT4)
양자화는 모델 가중치와 활성화를 낮은 비트폭으로 표현해 메모리와 캐시 요구량을 줄이는 기술입니다. AWQ나 GPTQ 같은 방법은 정밀도 저하를 최소화하면서 FP16 대비 메모리 사용을 크게 낮추고, INT4는 메모리 압박 완화를 위해 주로 사용되는 레버입니다. 품질 손실이 허용 범위를 벗어나면 FP16 또는 FP8을 기본으로 유지하는 결정 규칙이 권장됩니다.