용어 해설
- 프록시 탐색(Proxy Exploration)
- — 작은 규모의 프록시 모델을 사용해 보상 기반 탐색을 낮은 비용으로 수행하는 방식으로, 프록시가 환경에서 고보상 행동을 찾아내고 그 변화(정책의 상대적 개선)를 신호로 추출하는 과정이 핵심이다. 이 방법은 대형 모델에서 직접 샘플링할 때 발생하는 연산·샘플링 비용을 회피하고 병렬 탐색을 가능하게 한다.
- 업데이트 신호(Update Signal)
- — 프록시의 최적화 전후 토큰 확률의 로그비로 정의되는 토큰 수준의 상대적 개선값으로, 보상으로 유도된 방향성 정보(어떤 토큰을 장려 또는 억제할지)를 표현한다. 이 신호는 절대 분포가 아닌 방향성 정보이므로 다른 모델에 조정하여 전이할 수 있다.
- 분포 정렬(Distribution Matching)
- — 학생 모델을 사전 탐색으로 얻은 전문가 분포에 맞추는 방법으로, 샘플링 기반 보상 최적화 과정을 압축하여 빠르게 수렴시키는 이점이 있으나 탐색 단계에 의존한다는 한계가 있다. 본 논문에서는 탐색과 정렬을 분리해 재사용 가능한 신호를 얻는 관점에서 사용된다.
- 앵커 보정(Anchor Calibration)
- — 프록시에서 추출한 상대적 업데이트 신호를 기본(primary) 모델의 현재 분포와 비교하여 과도한 업데이트를 방지하기 위해 로그비 기반의 항목으로 보정하는 메커니즘이다. 보정계수 λ를 통해 보수성과 공격성 사이를 조절한다.
- OPD(분포 정렬 기반 방법)(OPD)
- — 사전에 최적화된 전문가 분포로 학생을 정렬하는 접근법으로, 탐색과 정렬을 분리한 병렬화 이점이 있으나 보상 인식(reward-awareness)이 본질적으로 부족하다는 한계가 관찰되었다. 본 논문은 OPD와 보상 최적화의 차이를 비교 분석하는 데 OPD를 기준으로 사용했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




