센터링(보상 중심화)
샘플된 토큰에 대한 보상에서 정책(학생) 하에서의 기대 보상을 빼는 조작으로 보상의 편향을 제거한다. 이렇게 하면 보상 신호의 방향성을 명확히 하고 단일 부호 편향으로 인한 학습 불안정을 완화할 수 있다. OPD²는 델타 신호에 센터링을 적용한 advantage를 사용한다.