본문으로 건너뛰기

K-quant

정밀도 기반 K-quant 양자화

K-quant는 Q4_K/Q5_K/Q6_K 같은 양자화 표기를 ExecuTorch에서 packed INT4/5/6로 매핑해 dp4a GEMV 같은 CUDA 명령 또는 MLX/Metal용 재포장·퓨즈 커널로 실행하는 양자화 방식이다. MLX 쪽에서는 손실이 없는 경우 인접 서브블록을 병합해 그룹 크기를 키워 메모리 접근과 연산을 효율화한다. 이 방식은 낮은 비트폭에서 decode·prefill 성능을 유지하면서 모델의 메모리 사용을 줄이는 목적을 가진다.