Quantization-Aware Distillation
양자화 인식 증류
양자화 과정에서 발생하는 오차를 고려해 저정밀도 Student 모델을 학습하는 방법입니다. 먼저 PTQ로 BF16 Teacher를 양자화한 뒤, 추론 시뮬레이션을 거친 Student의 출력 분포를 고정된 Teacher의 출력 분포에 맞춥니다. KL Divergence를 손실로 사용해 공격적인 양자화 뒤에도 원래 모델의 동작을 회복하는 데 의미가 있습니다.
양자화 인식 증류
양자화 과정에서 발생하는 오차를 고려해 저정밀도 Student 모델을 학습하는 방법입니다. 먼저 PTQ로 BF16 Teacher를 양자화한 뒤, 추론 시뮬레이션을 거친 Student의 출력 분포를 고정된 Teacher의 출력 분포에 맞춥니다. KL Divergence를 손실로 사용해 공격적인 양자화 뒤에도 원래 모델의 동작을 회복하는 데 의미가 있습니다.