본문으로 건너뛰기

Rebellious Student: RLRT—RLVR에서 교사 신호를 역방향으로 읽어 추론 탐색을 강화하는 Self-Distilled RLVR

자기-distillation의 교사–학생 간 정보 비대칭을 역전시켜 성공 롤아웃에서 학생의 독립적 추론을 증폭한다. RLRT는 토큰 수준에서 학생이 교사의 예측과 다르게 선택한 경우를 강화해 학습의 탐색 다양성 및 추론 품질을 높이고, 6개 수학 벤치마크에서 기존 기반 대비 성능 향상을 보인다. 이는 RLVR의 추론 한계를 넘어서 정보 비대칭을 탐색의 원천으로 삼는 설계 방향을 제시한다.

용어 해설

정보 비대칭(Information Asymmetry)
교사-학생 간 privileged context 차이에 의해 형성되는 정보 비대칭이 학습 신호로 작용하는 현상을 뜻한다. 교사는 c로 보강된 분포를 제공하고 학생은 이를 without-context 로 학습하므로, 토큰 수준의 신호 차이가 학습 방향과 탐색을 좌우한다.
Self-Distillation
한 모델이 교사와 학생 역할을 모두 수행하며 privileged context를 이용해 토큰 수준의 지식을 전달하는 방법이다. 실패 롤아웃에선 교사가 보완 정보를, 성공 롤아웃에선 교사 추종이 학생의 독립적 추론을 억제하는 문제점이 있다.
RLVR
Reinforcement Learning with Verifiable Rewards의 약자로, 강화학습-LLM에서 verifiable reward를 활용해 학습하는 프레임워크를 뜻한다.
RLRT
RLVR에서 교사의 신호를 역방향으로 읽는 RLRT( RLVR with Reversed Teacher ) 알고리즘으로, 성공 롤아웃에서 학생이 교사와 다르게 선택한 토큰을 증폭하는 탐색 신호를 제공한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 11.수집 2026. 05. 13.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.