quantisation
양자화
모델 가중치의 저장 비트 수를 줄여 메모리 사용량과 메모리 읽기 비용을 낮추는 압축 기법입니다. 16비트 가중치를 4비트로 바꾸면 모델 크기가 대략 4분의 1로 줄지만, 정확도 손실이 발생하므로 작업 유형과 허용 가능한 품질 저하를 함께 고려해야 합니다.
양자화
모델 가중치의 저장 비트 수를 줄여 메모리 사용량과 메모리 읽기 비용을 낮추는 압축 기법입니다. 16비트 가중치를 4비트로 바꾸면 모델 크기가 대략 4분의 1로 줄지만, 정확도 손실이 발생하므로 작업 유형과 허용 가능한 품질 저하를 함께 고려해야 합니다.