검증된 보상 기반 강화학습(RLVR)
RLVR는 생성된 CoT와 답안의 품질을 외부 검증으로 평가해 보상을 부여하는 학습 전략이다. 이 방식은 더 긴 CoT와 반성적 행동(reflection)을 유도해 수학적 추론 성능을 끌어올렸으나, 멀티모달 전반으로 일반화되지는 않았다.