최대값 몬테카를로
최대값 몬테카를로는 동일한 시작 상태에서 여러 번 참조 정책으로 롤아웃한 뒤 관측된 반환들 중 최대값을 라벨로 채택하는 전략이다. TerminalBench처럼 최적 정책을 직접 얻기 어려운 경우 MVMC(k=16 등)를 사용해 근사적인 높은 보장값을 얻는다. 이 방식은 확률적 정책의 우수한 연속을 포착하려는 목적에서 사용된다.