본문으로 건너뛰기

on-policy-vs-off-policy

온폴리시 대 오프폴리시

온폴리시는 정책 π_θ로 생성한 샘플로 업데이트를 수행하는 방식이고 오프폴리시는 고정된 전문가 분포 π_expert를 목표로 학습하는 방식이다. 본문에서는 온폴리시(RL)가 같은 입력에 대해 생성되는 롤아웃 간 분산을 제한해 잔차 성분만 남기는 반면, 오프폴리시(SFT)는 외부 분포를 맞추느라 큰 밀집 업데이트를 유도한다고 분석한다. 이 차이가 다중태스크 간섭의 크기를 결정하는 핵심 요소로 작동한다.