세계 대상 강화학습
에이전트가 시뮬레이션된 세계를 환경으로 사용해 정책을 강화학습(RL)으로 향상시키는 접근법이다. 기사에서는 그라운디드 검증기를 보상으로 사용하는 RL이 모방학습을 넘어선 성능 향상을 가져왔다고 설명한다. RL은 목표 도달에 필요한 단계 수를 줄이고 held-out 환경 성능을 개선했다고 명시되어 있다.