본문으로 건너뛰기

q-k-m

Q4_K_M 양자화

Q4_K_M은 모델 가중치를 낮은 비트 수로 저장해 메모리 사용량을 줄이는 양자화 형식입니다. 글에서는 262K와 1M 컨텍스트 설정에서 Q4_K_M을 사용해 더 높은 처리 속도를 얻었습니다.