K-quant 계열 양자화
Q2_K, Q3_K, Q4_K_M 같은 K-quant는 가중치를 저비트로 인코딩해 모델 파일 크기를 줄이면서도 런타임에서의 dequant 연산과 캐시 유효성, 파일백 접근 패턴을 고려해 성능·정확도 균형을 맞춥니다.