본문으로 건너뛰기

무작위로 선택된 Few-shot 지시를 통한 검증 가능한 보상으로 강화학습 성능 향상

RLVR은 검증 가능한 보상을 활용해 추론 능력을 향상시키는 프레임워크이며, 샘플 효율성이 낮아 복잡한 문제에서 학습 신호를 얻기 어렵다. FEST는 128개의 Demonstration으로 RLVR을 크게 개선하며, supervised learning, on-policy learning, decaying weights를 결합해 과적합를 방지한다. 이로써 대규모 SFT 데이터 의존 없이도 강건한 성능 향상이 가능하다는 점이 주목된다.

용어 해설

RLVR
RLVR은 코칭 가능한 보상을 주관적 선호가 아닌 단위 테스트나 정확한 문자열 매칭 같은 객관적이고 검증 가능한 기준으로 모델의 행동을 평가하고 학습시키는 강화학습 패러다임이다.
Direct Preference Optimization
DPO는 오프라인 데이터에서 선호 샘플(y+, y−)을 이용해 로그-시그모이드 형태의 손실을 최소화함으로써 보상 모델 없이 정책을 직접 최적화하는 방법이다.
그룹 상대 정책 최적화(Group Relative Policy Optimization)
GRPO는 그룹 평균 보상을 기준으로 각 샘플의 어드밴티지를 계산하고, 토큰 수준에서 클리핑된 그래디언트를 사용해 정책을 업데이트하는 강화학습 기법이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 14.수집 2026. 05. 16.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.