RL’s Razor
RL’s Razor (암묵적 KL 제약)
온폴리시 정책그라디언트가 KL 관점에서 초기 정책에 가까운 최적 정책을 선택하도록 암묵적으로 편향된다는 최근 이론적 결과의 호칭이다. 이 정리는 이진 보상 환경에서 정보투영(I-projection)과 모멘트투영(M-projection)의 번갈아 수행으로 업데이트가 해석될 수 있음을 보이며, 결과적으로 파라미터 편차가 작아져 희소하고 작은 업데이트가 유도된다고 연결된다. 본문에서는 이 성질을 RL 업데이트의 '작고 희소한' 특성의 이론적 근거로 사용한다.