본문으로 건너뛰기

숙련된 것은 내려놓고 남은 것을 학습하기

SA-MRPO는 포화된 보상 목적의 advantage를 낮춰 아직 어려운 correctness 목적에 학습 자원을 재배분합니다.

용어 해설

Group Relative Policy Optimization(GRPO)
같은 질의에서 생성한 여러 rollout의 보상을 비교해 각 응답의 상대적 우수성을 advantage로 바꾸는 정책 최적화 방식입니다. 학습된 value function 없이 그룹 평균과 표준편차로 신호를 정규화하므로 PPO보다 단순한 구조로 보상 기반 언어 모델 학습에 사용됩니다.
어드밴티지 추정(Advantage Estimation)
특정 rollout이 기준보다 얼마나 나은지를 수치화해 정책 업데이트의 방향과 크기를 결정하는 과정입니다. 양수 advantage는 해당 응답의 토큰 확률을 높이고 음수 advantage는 낮추도록 gradient를 전달합니다. 이 논문에서는 여러 보상 목적의 상대 성능을 결합하는 핵심 신호로 사용됩니다.
보상 스칼라화(Reward Scalarization)
여러 보상값을 미리 정한 가중합으로 하나의 scalar reward로 합치는 방식입니다. 서로 다른 보상 조합이 같은 합계가 되면 원래의 reward profile이 사라져 rollout 간 구분력이 낮아집니다. 논문은 이 손실을 피하기 위해 목적별 정규화 후 advantage를 결합합니다.
목적 포화(Objective Saturation)
특정 보상 목적이 달성 가능한 상한에 가까워져 추가 개선 여지가 작아진 상태입니다. 포화된 목적에 같은 가중치를 계속 배정하면 아직 낮은 목적보다 이미 해결된 목적에 gradient budget이 쓰일 수 있습니다. SA-MRPO는 batch 평균 보상과 사전에 정한 보상 범위로 이 상태를 측정합니다.
그래디언트 예산(Gradient Budget)
한 번의 정책 학습에서 각 보상 목적의 gradient가 차지하는 상대적인 최적화 자원입니다. 고정 가중치 방식에서는 목적의 현재 달성도와 무관하게 이 자원이 배분됩니다. SA-MRPO는 포화도가 높은 목적의 기여를 줄여 남은 보상 여지가 큰 목적에 자원을 이동시킵니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 17.수집 2026. 08. 19.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.