Reinforcement Learning with Verifiable Rewards
검증 가능한 보상 기반 강화학습
모델의 결과를 정답 판정기, 테스트, 증명 검사기처럼 자동 검증 가능한 기준으로 채점해 강화학습 보상으로 사용하는 방식이다. 사람의 주관적 평가 대신 이진 또는 명확한 보상을 제공하려면 환경과 verifier가 실제 작업의 성공 여부를 안정적으로 판정해야 한다.
검증 가능한 보상 기반 강화학습
모델의 결과를 정답 판정기, 테스트, 증명 검사기처럼 자동 검증 가능한 기준으로 채점해 강화학습 보상으로 사용하는 방식이다. 사람의 주관적 평가 대신 이진 또는 명확한 보상을 제공하려면 환경과 verifier가 실제 작업의 성공 여부를 안정적으로 판정해야 한다.