본문으로 건너뛰기

다이나믹 분산 적응 이점 최적화(DVAO): 다중 보상 강화학습을 위한 동적 가중치 조정

GRPO의 다중 목표 설정에서 고정 가중치는 목표 간 상호작용을 반영하지 못하고 학습의 불안정성을 악화시킨다. DVAO는 rollout 그룹 내 reward variance를 활용해 데이터에 기반한 가중치를 동적으로 조정하고, 학습 신호를 더 강하게 필요로 하는 목표에 집중시키며 잡음을 억제한다. 이러한 변화로 안정적인 학습과 더 나은 다목적 Pareto 최적 정책의 도달이 가능해진다.

용어 해설

rollout 그룹(rollout group)
롤아웃된 여러 시퀀스의 집합으로, 단일 입력에 대해 정책이 생성하는 후보 해들로 구성되며, 각 해의 성능을 비교하고 가중치를 계산하는 단위로 사용된다.
reward 결합(Reward Combination)
여러 보상을 선형 결합하여 하나의 총 보상을 만드는 방법으로, 학습 신호의 크기를 증가시키고 불안정성을 유발할 수 있다.
advantage 결합(Advantage Combination)
다중 목표의 각 보상으로부터 얻은 이점을 독립적으로 정규화한 뒤 가중치를 합산하는 방법으로, 목표 간 상관관계를 무시할 수 있다.
분산 기반 가중치(Variance-based weighting)
각 목표의 보상 분산을 이용해 가중치를 동적으로 조정하는 방법으로, 학습 신호의 강한 목표를 더 강조하고 약한 목표의 노이즈를 억제한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 25.수집 2026. 05. 27.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.