생성형 보상 모델
task와 두 레퍼런스 응답을 입력으로 받아 per-response leak 여부와 전체 pairwise 선호 점수를 생성하도록 RL로 학습한 모델이다. 학습 후에는 프롬프트별 주석 없이도 새로운 응답을 평가하는 데 사용된다.