Self-Distillation Fine-Tuning
모델의 온-정책 샘플을 학생 분포로 두고, 추가 문맥으로 생성된 교사 분포를 목표로 하여 KL 발산을 최소화해 업데이트하는 방법으로, 긴 추론흐름에서 오프-폴리시 체인을 직접 복사하지 않으면서 모델 행동을 정교화하는 데 사용된다.