시각적 추론용 GRPO
VR-GRPO는 전역 보상과 단계별 집중 보상을 결합한 강화학습 패러다임으로, 전체 과제 완료와 중간 단계의 물리적·논리적 일관성을 동시에 최적화한다. 생성된 여러 롤아웃 간 시점별 임베딩 분산을 계산해 불확실도가 큰 구간을 찾아내고 해당 하위구간을 VLM(pairwise)로 비교하여 세밀한 보상을 산출한다. 이 방식은 이미지-텍스트 쌍이나 과제별 휴리스틱 없이도 장기 계획과 미세 동역학을 학습하도록 설계되었다.