델타 신호
교사 모델의 추론 특성(추론 튜닝 후)과 그 교사 베이스(포스트트레이닝 이전) 사이의 로그확률 차이로 정의된 토큰 수준 보상 신호이다. 델타 신호는 추론 튜닝에서 새로 획득한 지식의 변화량을 직접적으로 포착하므로 추론 능력 전수에 초점을 맞춘다. 본 논문은 이 신호를 주된 학습 목표로 사용하여 on-policy distillation을 개선했다.