본문으로 건너뛰기

quantisation

양자화

모델 가중치의 저장 비트 수를 줄여 메모리 사용량과 메모리 읽기 비용을 낮추는 압축 기법입니다. 16비트 가중치를 4비트로 바꾸면 모델 크기가 대략 4분의 1로 줄지만, 정확도 손실이 발생하므로 작업 유형과 허용 가능한 품질 저하를 함께 고려해야 합니다.