On-Policy Reinforcement Learning
온폴리시 강화학습
현재 정책이 직접 생성한 rollout을 사용해 정책을 갱신하는 강화학습 방식입니다. 같은 질의에서 여러 출력을 샘플링하고 보상 차이를 비교해 어떤 출력을 강화할지 결정합니다. 데이터가 현재 정책의 탐색 범위에 묶인다는 점이 핵심 특성입니다.
온폴리시 강화학습
현재 정책이 직접 생성한 rollout을 사용해 정책을 갱신하는 강화학습 방식입니다. 같은 질의에서 여러 출력을 샘플링하고 보상 차이를 비교해 어떤 출력을 강화할지 결정합니다. 데이터가 현재 정책의 탐색 범위에 묶인다는 점이 핵심 특성입니다.