본문으로 건너뛰기

Fine-Grained Reward

세분화 보상

에이전트의 결과를 단일한 정답·오답이나 이산 점수로 줄이지 않고, 여러 평가 기준과 점수 토큰의 확률 분포를 이용해 연속적인 보상값으로 바꾸는 방식입니다. 작업 진행률 측정과 후보 궤적 선택의 정밀도를 높이는 데 쓰입니다.