Distribution matching
분포 정렬
학생 모델을 사전 탐색으로 얻은 전문가 분포에 맞추는 방법으로, 샘플링 기반 보상 최적화 과정을 압축하여 빠르게 수렴시키는 이점이 있으나 탐색 단계에 의존한다는 한계가 있다. 본 논문에서는 탐색과 정렬을 분리해 재사용 가능한 신호를 얻는 관점에서 사용된다.
분포 정렬
학생 모델을 사전 탐색으로 얻은 전문가 분포에 맞추는 방법으로, 샘플링 기반 보상 최적화 과정을 압축하여 빠르게 수렴시키는 이점이 있으나 탐색 단계에 의존한다는 한계가 있다. 본 논문에서는 탐색과 정렬을 분리해 재사용 가능한 신호를 얻는 관점에서 사용된다.