프록시 탐색
작은 규모의 프록시 모델을 사용해 보상 기반 탐색을 낮은 비용으로 수행하는 방식으로, 프록시가 환경에서 고보상 행동을 찾아내고 그 변화(정책의 상대적 개선)를 신호로 추출하는 과정이 핵심이다. 이 방법은 대형 모델에서 직접 샘플링할 때 발생하는 연산·샘플링 비용을 회피하고 병렬 탐색을 가능하게 한다.