교사 강제 순방향 추론
이미지를 조건으로 MLLM에 입력한 뒤 프롬프트 토큰을 정답으로 강제 제공하면서 각 다음 토큰의 조건부 확률을 계산하는 순방향 연산 방식이다. 이 절차로 얻은 토큰 우도들이 의미 스펙트럼을 구성하며 추가 학습 없이 보상 신호로 사용된다. 계산 비용이 낮고 훈련 없이 즉시 적용할 수 있다.