본문으로 건너뛰기

실패로부터 학습하기: Verifiable Rewards를 활용한 Correction-Oriented Policy Optimization(CIPO)

RLVR의 보상 신호는 희소하고 이진적이라 크레딧 할당이 불분명하다. CIPO는 실패를 교정 지향 감독으로 전환해 학습 방향성을 강화하고, 모델이 자신의 오류를 수정하는 능력을 키운다. 11개 벤치마크에서 일관된 추론 및 교정 성능 향상과 pass@K 증가를 보고한다.

용어 해설

RLVR
RLVR은 verifiable rewards를 온-폴리시 롤아웃에서 자동으로 확인 가능하게 사용하여 LLM의 추론 능력을 강화하는 강화학습 프레임워크이다. 보상은 이진형으로 제공되며, 신호의 희소성을 완화하고 크레딧 배분의 불확실성을 줄인다.
GRPO
GRPO는 그룹 내의 실패/성공 샘플 간 상대 이점을 이용해 정책을 업데이트하는 RLVR 방법으로, 그룹 평균에 비해 양의 기여를 가지는 샘플을 강화하고 음의 기여를 가진 샘플을 제약한다.
CIPO
CIPO는 on-policy 실패 샘플에서 교정 샘플을 생성해 교정 지향 감독으로 학습 신호를 제공하는 RLVR 확장이다. 실패를 단순한 패널티가 아닌 교정 학습의 근거로 활용한다.
적응형 재생(Adaptive Replay)
적응형 재생은 성공 샘플과 실패 샘플의 비율 ρt를 동적으로 조정하여 학습의 안정성과 효과를 균형 있게 유지하는 기법이다.
리스크 회피 보상 설계(Risk-Averse Reward Shaping)
핵심은 조건부로 성공에서 실패로의 전이를 억제하는 비대칭 보상으로, 'correct → incorrect' 전이를 페널티화하여 기존 올바른 행동의 보존을 강화한다.
난이도 인지 샘플(Difficulty-aware Trajectories)
중간 난이도의 프롬프트를 우선 재생하는 학습 전략으로, 너무 쉽거나 너무 어려운 샘플의 학습 효과를 회피한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 14.수집 2026. 05. 19.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.