Centering
센터링(보상 중심화)
샘플된 토큰에 대한 보상에서 정책(학생) 하에서의 기대 보상을 빼는 조작으로 보상의 편향을 제거한다. 이렇게 하면 보상 신호의 방향성을 명확히 하고 단일 부호 편향으로 인한 학습 불안정을 완화할 수 있다. OPD²는 델타 신호에 센터링을 적용한 advantage를 사용한다.
센터링(보상 중심화)
샘플된 토큰에 대한 보상에서 정책(학생) 하에서의 기대 보상을 빼는 조작으로 보상의 편향을 제거한다. 이렇게 하면 보상 신호의 방향성을 명확히 하고 단일 부호 편향으로 인한 학습 불안정을 완화할 수 있다. OPD²는 델타 신호에 센터링을 적용한 advantage를 사용한다.