본문으로 건너뛰기

On-Policy Reinforcement Learning

온폴리시 강화학습

현재 정책이 직접 생성한 rollout을 사용해 정책을 갱신하는 강화학습 방식입니다. 같은 질의에서 여러 출력을 샘플링하고 보상 차이를 비교해 어떤 출력을 강화할지 결정합니다. 데이터가 현재 정책의 탐색 범위에 묶인다는 점이 핵심 특성입니다.