Quantization-Aware Healing
양자화 인지 복구
구조 압축과 4비트 양자화로 성능이 떨어진 모델을 원래의 전체 크기·Full-precision 교사 모델에서 직접 지식 증류해 회복하는 방법이다. 학생 모델은 교사의 출력 Logits 분포를 KL Divergence로 맞추며, 기존 복구 모델의 성능 상한을 넘도록 학습한다.
양자화 인지 복구
구조 압축과 4비트 양자화로 성능이 떨어진 모델을 원래의 전체 크기·Full-precision 교사 모델에서 직접 지식 증류해 회복하는 방법이다. 학생 모델은 교사의 출력 Logits 분포를 KL Divergence로 맞추며, 기존 복구 모델의 성능 상한을 넘도록 학습한다.