본문으로 건너뛰기

Reinforcement Learning with Verifiable Rewards

검증 가능한 보상 기반 강화학습

모델의 결과를 정답 판정기, 테스트, 증명 검사기처럼 자동 검증 가능한 기준으로 채점해 강화학습 보상으로 사용하는 방식이다. 사람의 주관적 평가 대신 이진 또는 명확한 보상을 제공하려면 환경과 verifier가 실제 작업의 성공 여부를 안정적으로 판정해야 한다.