forward-kl-divergence
Forward KL Divergence
teacher 분포가 부여한 확률 질량을 student가 놓치지 않도록 두 다음 토큰 분포의 차이를 계산하는 발산입니다. u-OPSD는 $D_{KL}(\pi_T\|\pi_S)$를 사용해 teacher의 전체 어휘 분포를 student가 각 토큰 위치에서 따라가도록 학습합니다.
Forward KL Divergence
teacher 분포가 부여한 확률 질량을 student가 놓치지 않도록 두 다음 토큰 분포의 차이를 계산하는 발산입니다. u-OPSD는 $D_{KL}(\pi_T\|\pi_S)$를 사용해 teacher의 전체 어휘 분포를 student가 각 토큰 위치에서 따라가도록 학습합니다.