용어 해설
- 정책 인식 루브릭 보상(Policy-Aware Rubric Rewards)
- — 루브릭의 각 평가 항목에 인간이 부여한 가중치를 유지하되, 학습 신호로써 현재 모델이 어떤 기준을 더 잘 구분하는가에 따라 보상 가중치를 동적으로 재조정하는 아이디어를 말한다.
- POW3R
- — 루브릭의 기준별 보상 가중치를 정책의 rollout에서의 차등 신호에 맞추어 재가중하는 프레임워크. within-category 분모를 보존하면서 contrastive 기준에 추가 신호를 제공한다.
- GRPO
- — Group Relative Policy Optimization으로, 한 프롭프트에 대해 여러 출력(o1,...,oG)을 그룹으로 샘플링하고, 각 출력에 로컬 보상을 배포하는 학습 알고리즘이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.






