Fine-Grained Reward
세분화 보상
에이전트의 결과를 단일한 정답·오답이나 이산 점수로 줄이지 않고, 여러 평가 기준과 점수 토큰의 확률 분포를 이용해 연속적인 보상값으로 바꾸는 방식입니다. 작업 진행률 측정과 후보 궤적 선택의 정밀도를 높이는 데 쓰입니다.
세분화 보상
에이전트의 결과를 단일한 정답·오답이나 이산 점수로 줄이지 않고, 여러 평가 기준과 점수 토큰의 확률 분포를 이용해 연속적인 보상값으로 바꾸는 방식입니다. 작업 진행률 측정과 후보 궤적 선택의 정밀도를 높이는 데 쓰입니다.