분포 정렬
학생 모델을 사전 탐색으로 얻은 전문가 분포에 맞추는 방법으로, 샘플링 기반 보상 최적화 과정을 압축하여 빠르게 수렴시키는 이점이 있으나 탐색 단계에 의존한다는 한계가 있다. 본 논문에서는 탐색과 정렬을 분리해 재사용 가능한 신호를 얻는 관점에서 사용된다.