Off-policy Reinforcement Learning
오프폴리시 강화학습
과거에 수집한 상태·행동·보상 전이를 replay buffer에 저장한 뒤 현재 정책 학습에 재사용하는 강화학습 방식이다. 환경 상호작용 데이터를 여러 번 활용해 데이터 효율을 높이지만, 현재 정책이 거의 방문하지 않은 영역의 가치를 추정할 때 extrapolation error가 발생할 수 있다.
오프폴리시 강화학습
과거에 수집한 상태·행동·보상 전이를 replay buffer에 저장한 뒤 현재 정책 학습에 재사용하는 강화학습 방식이다. 환경 상호작용 데이터를 여러 번 활용해 데이터 효율을 높이지만, 현재 정책이 거의 방문하지 않은 영역의 가치를 추정할 때 extrapolation error가 발생할 수 있다.