본문으로 건너뛰기

offline-to-online-rl

오프라인 투 온라인 강화학습

사전 수집 데이터로 초기 정책을 학습한 뒤 실제 환경이나 시뮬레이션에서 추가 상호작용으로 미세 조정하는 하이브리드 절차로, 초기 안정성과 이후 적응성의 균형을 목표로 한다. 전이 지점(phase transition)과 분포 이동 관리가 핵심 설계 요소이다.