용어 해설
- RLVR
- — RLVR은 verifiable rewards를 온-폴리시 롤아웃에서 자동으로 확인 가능하게 사용하여 LLM의 추론 능력을 강화하는 강화학습 프레임워크이다. 보상은 이진형으로 제공되며, 신호의 희소성을 완화하고 크레딧 배분의 불확실성을 줄인다.
- GRPO
- — GRPO는 그룹 내의 실패/성공 샘플 간 상대 이점을 이용해 정책을 업데이트하는 RLVR 방법으로, 그룹 평균에 비해 양의 기여를 가지는 샘플을 강화하고 음의 기여를 가진 샘플을 제약한다.
- CIPO
- — CIPO는 on-policy 실패 샘플에서 교정 샘플을 생성해 교정 지향 감독으로 학습 신호를 제공하는 RLVR 확장이다. 실패를 단순한 패널티가 아닌 교정 학습의 근거로 활용한다.
- 적응형 재생(Adaptive Replay)
- — 적응형 재생은 성공 샘플과 실패 샘플의 비율 ρt를 동적으로 조정하여 학습의 안정성과 효과를 균형 있게 유지하는 기법이다.
- 리스크 회피 보상 설계(Risk-Averse Reward Shaping)
- — 핵심은 조건부로 성공에서 실패로의 전이를 억제하는 비대칭 보상으로, 'correct → incorrect' 전이를 페널티화하여 기존 올바른 행동의 보존을 강화한다.
- 난이도 인지 샘플(Difficulty-aware Trajectories)
- — 중간 난이도의 프롬프트를 우선 재생하는 학습 전략으로, 너무 쉽거나 너무 어려운 샘플의 학습 효과를 회피한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


