대조적 증거 게이팅
교사에게 양성(positive)과 음성(negative) 시각 증거 뷰를 제공해 동일한 학생 롤아웃을 두 뷰에서 재생한 뒤, 토큰 단위 로그확률 차이를 평균해 롤아웃 수준의 증거 우위를 계산하고 이 값을 정규화·클리핑해 OPD 손실에 가중치로 적용하는 메커니즘이다.