Advantage Inversion
어드밴티지 반전
강화학습에서 평균보다 높은 보상을 받은 출력이 음의 advantage를 받는 현상입니다. 정답 rollout을 기존 rollout 집합에 섞으면 높은 정답 보상이 그룹 평균을 올려 이런 반전이 발생합니다. 결과적으로 강화해야 할 정책 출력을 억제할 수 있습니다.
어드밴티지 반전
강화학습에서 평균보다 높은 보상을 받은 출력이 음의 advantage를 받는 현상입니다. 정답 rollout을 기존 rollout 집합에 섞으면 높은 정답 보상이 그룹 평균을 올려 이런 반전이 발생합니다. 결과적으로 강화해야 할 정책 출력을 억제할 수 있습니다.