본문으로 건너뛰기

Tensor-Level Allocation

Tensor-Level Allocation

양자화 예산을 모든 tensor에 동일하게 배분하지 않고, 평가하려는 능력에서 손상이 큰 tensor에 더 높은 정밀도를 배정하는 방식입니다. 전체 모델의 가중치 값을 학습하거나 바꾸지 않고 정밀도가 사용되는 위치만 재분배해 제한된 바이트 예산 안에서 특정 능력의 보존을 노립니다.