본문으로 건너뛰기

프록시 탐색과 재사용 가능한 지침: 프록시 유도 업데이트 신호(PUST)를 통한 모듈형 LLM 포스트 트레이닝

PUST는 경량 프록시에서 보상 기반 탐색으로 얻은 토큰 수준의 상대적 업데이트 신호를 앵커 보정하여 대형 모델에 전이함으로써 탐색 비용을 낮추고 신호의 캐시·재사용을 가능하게 했다.

용어 해설

프록시 탐색(Proxy Exploration)
작은 규모의 프록시 모델을 사용해 보상 기반 탐색을 낮은 비용으로 수행하는 방식으로, 프록시가 환경에서 고보상 행동을 찾아내고 그 변화(정책의 상대적 개선)를 신호로 추출하는 과정이 핵심이다. 이 방법은 대형 모델에서 직접 샘플링할 때 발생하는 연산·샘플링 비용을 회피하고 병렬 탐색을 가능하게 한다.
업데이트 신호(Update Signal)
프록시의 최적화 전후 토큰 확률의 로그비로 정의되는 토큰 수준의 상대적 개선값으로, 보상으로 유도된 방향성 정보(어떤 토큰을 장려 또는 억제할지)를 표현한다. 이 신호는 절대 분포가 아닌 방향성 정보이므로 다른 모델에 조정하여 전이할 수 있다.
분포 정렬(Distribution Matching)
학생 모델을 사전 탐색으로 얻은 전문가 분포에 맞추는 방법으로, 샘플링 기반 보상 최적화 과정을 압축하여 빠르게 수렴시키는 이점이 있으나 탐색 단계에 의존한다는 한계가 있다. 본 논문에서는 탐색과 정렬을 분리해 재사용 가능한 신호를 얻는 관점에서 사용된다.
앵커 보정(Anchor Calibration)
프록시에서 추출한 상대적 업데이트 신호를 기본(primary) 모델의 현재 분포와 비교하여 과도한 업데이트를 방지하기 위해 로그비 기반의 항목으로 보정하는 메커니즘이다. 보정계수 λ를 통해 보수성과 공격성 사이를 조절한다.
OPD(분포 정렬 기반 방법)(OPD)
사전에 최적화된 전문가 분포로 학생을 정렬하는 접근법으로, 탐색과 정렬을 분리한 병렬화 이점이 있으나 보상 인식(reward-awareness)이 본질적으로 부족하다는 한계가 관찰되었다. 본 논문은 OPD와 보상 최적화의 차이를 비교 분석하는 데 OPD를 기준으로 사용했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 13.수집 2026. 07. 15.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.