용어 해설
- RLVR
- — RLVR은 코칭 가능한 보상을 주관적 선호가 아닌 단위 테스트나 정확한 문자열 매칭 같은 객관적이고 검증 가능한 기준으로 모델의 행동을 평가하고 학습시키는 강화학습 패러다임이다.
- Direct Preference Optimization
- — DPO는 오프라인 데이터에서 선호 샘플(y+, y−)을 이용해 로그-시그모이드 형태의 손실을 최소화함으로써 보상 모델 없이 정책을 직접 최적화하는 방법이다.
- 그룹 상대 정책 최적화(Group Relative Policy Optimization)
- — GRPO는 그룹 평균 보상을 기준으로 각 샘플의 어드밴티지를 계산하고, 토큰 수준에서 클리핑된 그래디언트를 사용해 정책을 업데이트하는 강화학습 기법이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.






