참조 정책
참조 정책은 상태-행동 쌍에 대해 Qπ(s,a)를 산출하는 데 사용되는 연속 정책으로, 가능한 한 최적에 가깝게 설정하여 높은 Q 값이 진짜 높은 가치임을 보장한다. QVal은 환경별로 최적 스크립트, 플래너, 또는 MVMC로 얻은 강한 모델 기반 정책을 참조 정책으로 사용한다. 참조 정책은 평가 라벨을 생성할 때만 필요하며 이후 신호 활용 시 동일 정책을 요구하지 않는다.