본문으로 건너뛰기
HF Daily Papers조회 1

안락한 영역을 벗어나게 하는 넛지: RLVR를 위한 전략 주도형 탐색의 효율화

RLVR의 핵심은 탐색의 질이다. naive 롤아웃 확장은 비용이 매우 크고, 정책이 이미 샘플링한 경로에만 개선이 가능하다. 본 연구는 Strategy Nudging으로 컨텍스트를 도입해 다양한 추론 모드를 강제 탐색하도록 하고, Inter-Intra Group Advantage와 디스틸레이션으로 발견된 유용한 전략을 기본 프롬프트 정책으로 전이시킴으로써 적은 롤아웃으로도 GRPO 대비 우수한 성능을 달성한다. 실험에서 8배 큰 롤아웃 예산을 사용한 GRPO를 능가하고, oracle 기반 프리픽스 방법보다도 우수한 성과를 보인다.

용어 해설

전략 넛지(Strategy Nudging)
전략 수준의 컨텍스트를 입력에 첨부해 롤아웃 생성 시 서로 다른 추론 모드를 의도적으로 탐색하게 하는 탐색 기법이다. 이로써 학습 중에 드물고 다양한 해결 전략을 노출시키고, 이후 기본 프롬프트로의 일반화 가능성을 높인다.
인터-인트라 그룹 어드밴티지(Inter-Intra Group Advantage)
_CONTEXT--conditioned_ 롤아웃을 여러 그룹으로 나눈 뒤, 그룹 내부와 그룹 간의 보상을 모두 고려해 크레딧을 분배하는 값산 기법이다. 서로 다른 컨텍스트 간의 편향을 보정하고 일관된 학습 신호를 유도한다.
디스틸레이션 보강 RL 목표(Distillation-Augmented RL Objective)
-context-conditioned_ 탐색에서 발견된 고-가치 행동을 base 프롬프트의 정책으로 디스틸링하여 일반화시키는 학습 목표다. LDistill를 통해 효과적인 행동만 정책에 반영한다.
특권 정보(Privileged Information)
오라클 솔루션이나 중간 해답과 같은 외부 신호에 의존하는 학습 방식의 한계를 설명하는 용어다. 본 연구는 이와 달리 컨텍스트 기반의 다양성 탐색에 초점을 맞춘다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 15.수집 2026. 05. 19.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.