상상 내 강화학습
학습된 월드 모델이 생성한 가상 롤아웃을 환경 상호작용 없이 정책 학습에 직접 사용하는 방식으로서 입력으로 모델의 상태·행동 예측을 받고 정책이 출력되는 구조이다. 글에서는 동일한 모델과 데이터에서 RL-in-imagination이 실패하는 사례와 대비되어 검증 실험으로 쓰였다.