본문으로 건너뛰기

Grouped RL

Grouped RL

여러 샘플 그룹을 비교하여 강화학습을 수행하는 방식이다. 샘플 간의 불일치를 보상 신호로 활용하여 모델의 오류를 교정한다.