드림 리허설
월드 모델이 생성한 상상 롤아웃을 이용하되, 그 경로들에 대해 오프라인에서 채점(graded scoring)하고 감독 학습 방식으로 자기 모방을 수행하는 기법이다. 본문 실험에서는 동일한 상상 데이터와 고정된 모델을 쓰면서 학습 경로만 바꿔 행동 복구에 성공한 핵심 처리 절차로 제시된다.