q4-k-m
Q4_K_M 양자화
Q4_K_M은 모델 가중치를 4비트 수준으로 압축하는 GGUF 계열 양자화 방식입니다. 원본 가중치보다 메모리 사용량을 줄여 소비자용 GPU에서 대형 LLM을 실행할 수 있게 하지만, 모델 품질과 추론 특성은 설정과 모델에 따라 달라질 수 있습니다.
Q4_K_M 양자화
Q4_K_M은 모델 가중치를 4비트 수준으로 압축하는 GGUF 계열 양자화 방식입니다. 원본 가중치보다 메모리 사용량을 줄여 소비자용 GPU에서 대형 LLM을 실행할 수 있게 하지만, 모델 품질과 추론 특성은 설정과 모델에 따라 달라질 수 있습니다.