용어 해설
- Group Relative Policy Optimization(GRPO)
- — 같은 질의에서 생성한 여러 rollout의 보상을 비교해 각 응답의 상대적 우수성을 advantage로 바꾸는 정책 최적화 방식입니다. 학습된 value function 없이 그룹 평균과 표준편차로 신호를 정규화하므로 PPO보다 단순한 구조로 보상 기반 언어 모델 학습에 사용됩니다.
- 어드밴티지 추정(Advantage Estimation)
- — 특정 rollout이 기준보다 얼마나 나은지를 수치화해 정책 업데이트의 방향과 크기를 결정하는 과정입니다. 양수 advantage는 해당 응답의 토큰 확률을 높이고 음수 advantage는 낮추도록 gradient를 전달합니다. 이 논문에서는 여러 보상 목적의 상대 성능을 결합하는 핵심 신호로 사용됩니다.
- 보상 스칼라화(Reward Scalarization)
- — 여러 보상값을 미리 정한 가중합으로 하나의 scalar reward로 합치는 방식입니다. 서로 다른 보상 조합이 같은 합계가 되면 원래의 reward profile이 사라져 rollout 간 구분력이 낮아집니다. 논문은 이 손실을 피하기 위해 목적별 정규화 후 advantage를 결합합니다.
- 목적 포화(Objective Saturation)
- — 특정 보상 목적이 달성 가능한 상한에 가까워져 추가 개선 여지가 작아진 상태입니다. 포화된 목적에 같은 가중치를 계속 배정하면 아직 낮은 목적보다 이미 해결된 목적에 gradient budget이 쓰일 수 있습니다. SA-MRPO는 batch 평균 보상과 사전에 정한 보상 범위로 이 상태를 측정합니다.
- 그래디언트 예산(Gradient Budget)
- — 한 번의 정책 학습에서 각 보상 목적의 gradient가 차지하는 상대적인 최적화 자원입니다. 고정 가중치 방식에서는 목적의 현재 달성도와 무관하게 이 자원이 배분됩니다. SA-MRPO는 포화도가 높은 목적의 기여를 줄여 남은 보상 여지가 큰 목적에 자원을 이동시킵니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

