본문으로 건너뛰기
HF Daily Papers조회 1

언어 피드백을 활용한 Variational Policy Distillation

강화학습에서 verifiable rewards의 희소성으로 인한 탐험 문제를 완화하기 위해 언어 피드백을 이용한 학습이 제시된다. SDPO 등의 기존 방법은 피드백 해석의 고정된 교사에 의존하는 한계를 가진다. 본 논문은 교사와 학생을 함께 진화시키는 Variational EM 프레임워크를 도입하고, 동적 신뢰 영역으로 교사 업데이트를 제한하여 토큰 수준의 풍부한 피드백 신호를 지속적으로 활용한다. 이로써 코드 생성, 과학 추론, 수학적 문제 해결 등 다양한 도메인에서 RLVR 및 기존 자기-증류 baselines를 일관되게 능가한다.

추가 이미지 분석

Biology Ablation Reference: E-step의 업데이트 빈도(F) 영향
Chart

F=5가 최적의 트러스트 영역을 제공한다는 ablation 결과를 시각적으로 보여준다. F가 너무 작으면 목표 분포가 불안정하고, 너무 크면 목표가 오래 유지되어 학습이 둔화될 수 있음을 시사한다.

Biology Ablation Reference: E-step의 업데이트 빈도(F) 영향

Chemistry Ablation Reference: 화학 도메인 Ablaation
Chart

Chemistry 도메인에서의 ablation 차이를 요약한다. Dynamic prior의 효과를 도메인 전반에서 확인하며, E-step 빈도와 피드백 신호의 질에 따른 성능 차이를 보여준다.

Chemistry Ablation Reference: 화학 도메인 Ablaation

용어 해설

KL 발산(KL Divergence)
확률 분포 간의 차이를 측정하는 비대칭적 거리로, 두 분포가 일치할 때 0에 접근한다. 본 논문에서는 qϕ(y|x,C)와 π*(y|x) 간의 차이를 최소화하는 학습 목표에 활용된다.
증거 하한(Evidence Lower Bound)
잠재 변수 모델에서 실제 가능 분포의 로그 가능도에 대한 하한으로 제시되는 기대값-쿨라에서 파생된 바운드다. 본 논문에서 log Z(x)의 하한으로 활용된다.
기대 최대화(Expectation-Maximization)
잠재 변수 모형에서 변수의 분포를 추정하는 E-스텝과 파라미터를 업데이트하는 M-스텝의 교대 최적화 알고리즘. 본 연구의 핵심 최적화 프레임워크로 사용된다.
트러스트 영역(Trust Region)
학습 초기에 모델이 큰 폭으로 변화하지 않도록 허용되는 파라미터 업데이트 범위를 제한하는 기법. 본 논문은 동적 프라이어를 통해 교사-학생 간의 업데이트를 제어한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 18.수집 2026. 05. 22.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.