본문으로 건너뛰기

Quantization-Aware Healing

양자화 인지 복구

구조 압축과 4비트 양자화로 성능이 떨어진 모델을 원래의 전체 크기·Full-precision 교사 모델에서 직접 지식 증류해 회복하는 방법이다. 학생 모델은 교사의 출력 Logits 분포를 KL Divergence로 맞추며, 기존 복구 모델의 성능 상한을 넘도록 학습한다.