본문으로 건너뛰기

q4-weights

Q4 양자화 가중치

모델의 가중치를 4비트 수준으로 압축한 형식으로, 원본보다 메모리 사용량을 줄여 로컬 하드웨어에서 더 큰 모델을 실행하게 합니다. 글의 27B 모델에서는 Q4 가중치 용량이 약 15GB였고, 메모리 대역폭이 추론 속도의 주요 제약으로 작용했습니다.