TL;DR
GRPO의 다중 목표 설정에서 고정 가중치는 목표 간 상호작용을 반영하지 못하고 학습의 불안정성을 악화시킨다. DVAO는 rollout 그룹 내 reward variance를 활용해 데이터에 기반한 가중치를 동적으로 조정하고, 학습 신호를 더 강하게 필요로 하는 목표에 집중시키며 잡음을 억제한다. 이러한 변화로 안정적인 학습과 더 나은 다목적 Pareto 최적 정책의 도달이 가능해진다.
왜 중요한가
GRPO의 다중 목표 설정에서 고정 가중치는 목표 간 상호작용을 반영하지 못하고 학습의 불안정성을 악화시킨다. DVAO는 rollout 그룹 내 reward variance를 활용해 데이터에 기반한 가중치를 동적으로 조정하고, 학습 신호를 더 강하게 필요로 하는 목표에 집중시키며 잡음을 억제한다. 이러한 변화로 안정적인 학습과 더 나은 다목적 Pareto 최적 정책의 도달이 가능해진다.
핵심 기여
Dynamic variance-adaptive weighting
복수 목표의 보상 분산을 이용해 w̃k = wk σi k / Σl wl σi l 로 가중치를 계산하고, 각 목표의 기여도를 상황에 맞게 조정한다. 이를 통해 학습 신호의 크기를 안정적으로 제어하고 노이즈를 줄인다.
Bounded gradient magnitudes
보상 결합(Reward Combination)에서의 이득 크기 폭주 문제를 완화하고, 학습의 수렴 안정성을 보장하는 이론적 경계가 성립한다.
Cross-objective regularization via DVAO
단일 목표의 민감도 대신 전체 다중 목표 성능에 기반한 교차 상호작용 항을 도입해, 특정 목표의 과도한 최적화로부터 다른 목표를 보호하는 정규화 효과를 구현한다.
Empirical validation on LLM reasoning/tool-use
Qwen3/Qwen2.5 계열 모델을 통해 수학적 추론 및 도구 사용 벤치마크에서 DVAO가 Pareto 프런티어 상에서 우수한 성능과 훈련 안정성을 달성함을 실험적으로 보여준다.
핵심 아이디어 이해하기
단락 1. 다중 목표를 다루는 GRPO에서 보상 합성은 단순 선형 결합으로 구현되며, 이는 학습 신호의 크기를 비대칭하게 키워 정책의 불안정을 초래할 수 있다. 또한 Advantage Combination은 목표 간 상관관계를 반영하지 못하고 고정된 하이퍼파라미터에 의존한다. 단락 2. DVAO는 각 목표의 보상 분산 σi k를 활용해 가중치를 동적으로 재배치한다. 구체적으로 w̃k = wk σi k / Σl wl σi l로 정의하고, 전체 다목적 이득 A(i,j)DVAO를 A(i,j)k에 대해 가중합한다. 이때 입력은 rollout 그룹에서의 보상 샘플이며, 분산이 큰 목표는 학습 신호가 커져 영향력이 커진다. 입력: r(i,j)sum = Σk wk r(i,j)k → 출력: A(i,j)sum = Σk wk A(i,j)k; DVAO의 가중치는 σi k에 비례하여 계산되고, 이를 통해 데이터에 기반한 동적 스케일링이 수행된다.
방법론
단락 3. 수학적 구성은 r(i,j)sum = Σk w̃k A(i,j)k로 표현되며, w̃k는 w_k σi k / Σl wl σi l로 정의된다. 따라서 A(i,j)DVAO = Σk w̃k A(i,j)k가 된다. 단락 4. 이 특성의 이점은 Proposition 2에서 보상 결합으로부터의 이득 크기를 점진적으로 감소시켜 bounded magnitude를 보장한다는 점이며, Proposition 3에서 A(i,j)DVAO의 k-th raw reward에 대한 편미분이 cross-term A(i,j)DVAOA(i,j)k에 의해 결정되어 교차 목표 정규화를 가능하게 한다.
주요 결과
주요 벤치마크에서 DVAO는 모든 모델 규모에서 최고 수준의 정확도와 포맷/길이 규정 준수를 달성하는 경향을 보이며, Pareto frontier에서도 다른 방법들을 모두 앞서는 경향을 보인다. 수치가 주어진 표를 통해 각 도메인에서 DVAO가 기존 GRPO, RC, AC, GDPO 대비 더 나은 다목적 성능을 보여주며, 특히 수학적 추론 태스크에서 복합적인 목표 간의 균형이 강화된다. Training dynamics 그래프는 DVAO가 정확도 보상(mean)과 길이 보상(mean)을 빠르게 끌어올리며 표준편차를 가장 크게 감소시키는 경향을 나타낸다. Pareto frontier 도식은 weight sweep에 따른 정확도-길이/형식 간의 trade-off에서 DVAO가 상위 우측 영역을 지속적으로 차지함을 보여준다.
관련 Figure

세 부분으로 구성된 학습 곡선에서 DVAO가 평균 정확도 보상을 다른 방법들보다 높게 유지하고 표준편차를 더 빨리 감소시키는 경향을 보인다. 이는 DVAO의 variance-aware normalization이 학습 신호의 견고함을 강화한다는 것을 시사한다.
Figure 1: Qwen3-4B-Base에서 정확도 보상과 길이 보상의 평균/표준편차 및 평균 응답 길이의 학습 dynamics를 보여주는 그래프들.

대형 모델에서도 DVAO가 다른 방법들에 비해 더 높은 평균 정확도 보상을 유지하고 표준편차를 빠르게 줄인다. 이로써 DVAO가 다양한 모델 규모에서 안정적인 학습을 제공함을 확인한다.
Figure 2: Qwen3-8B-Base에서 학습 dynamics의 정확도 보상 및 길이 보상 그래프.

DVAO가 Pareto 프런티어의 상단 우측 영역에서 다른 방법들을 지속적으로 앞지르는 경향을 보이며, 다양한 가중치 설정에서 최적의 트레이드오프를 제공한다.
Figure 3a: Qwen3-4B-Base의 Pareto frontier(정확도 vs 길이/포맷) 차트.

도메인별로도 DVAO가 다른 방법들보다 우수한 다목적 트레이드오프를 제공하며, tool-use 태스크에서도 형식 준수와 정확도 간의 균형을 잘 달성한다.
Figure 3b: Qwen2.5-3B-Instruct의 Pareto frontier 차트.
기술 상세
단락 1: 전체 아키텍처 구조 - GRPO 기반의 다중 보상 정책 최적화 프레임워크에서 DVAO는 가중치를 동적으로 조정하는 모듈을 도입한다. 단락 2: 핵심 메커니즘의 수학적/알고리즘적 기반 - r(i,j)sum = Σk w_k r(i,j)k, A(i,j)sum = Σk w_k A(i,j)k, w̃k = wk σi k / Σl wl σi l, A(i,j)DVAO = Σk w̃k A(i,j)k, S_i = Σk w̃k σi k; A(i,j)DVAOA(i,j)k를 통해 교차-목적 정규화를 구현한다. 패턴: 입력(r) → 분산 계산 → 가중치 재조정 → 출력(A)로 연결. 단락 3: Prior work 대비 기술적 차별점 - 고정 가중치의 한계와 상관관계 무시 문제를 해소하고, 분산 기반 가중치를 통해 학습 신호의 강도를 목표 간 상관관계에 맞춰 조절한다. 단락 4: 구현 및 학습 세부사항, 이론적 분석 - rollout 그룹 G(예: G=16)에서 분산 σ를 추정하고, AdamW 최적화 사용, 학습 스텝 500, 최대 토큰 8192 등 하이퍼파라미터를 고정하고 실험한다. 이론적 근거로 Proposition 2(가중 합의 이득 크기 한정)와 Proposition 3(편미분에 의한 교차-목적 규제) 제시.
한계점
범용성에 한계가 존재한다. (1) rollout 그룹 크기 G의 증가에 따른 분산 추정의 샘플 편향 가능성, 메모리 제약으로 G가 작은 경우 잡음이 커질 수 있음. (2) 듀얼-객관도에 주로 초점을 맞춰 실험되었으나 다중 목표가 더 확장될 경우의 일반화에 대한 추가 연구 필요. (3) 보상 정의의 품질에 의존하므로 노이즈가 큰 보상이 상향 가중될 수 있어 보상 설계의 신뢰성이 요구된다.
실무 활용
다중 목표를 동시에 최적화해야 하는 LLM 정책 학습에 즉시 적용 가능하며, 학습 안정성과 Pareto 최적의 다목적 정책 달성에 기여한다.
- 다중 목표 RL에서 고정 가중치를 제거하고 variance 기반 동적 가중치를 적용해 안정성과 수렴 속도를 개선한다.
- LLM의 추론 길이 제한과 형식 요구사항을 동시에 만족시키는 도구 사용 태스크에서 성능과 형식 준수를 모두 향상시킨다.
- 다목적 GRPO 환경에서 Pareto frontier를 개선해 사용자 선호를 더 잘 반영하는 정책을 찾는 데 활용한다.
- 코드 없이도 학습 신호의 분산 정보를 이용해 손쉽게 적용 가능한 가중치 재조정 아이디어를 제공한다.
코드 공개 여부: 비공개
키워드
용어 해설
- rollout group
- — 롤아웃된 여러 시퀀스의 집합으로, 단일 입력에 대해 정책이 생성하는 후보 해들로 구성되며, 각 해의 성능을 비교하고 가중치를 계산하는 단위로 사용된다.
- Reward Combination
- — 여러 보상을 선형 결합하여 하나의 총 보상을 만드는 방법으로, 학습 신호의 크기를 증가시키고 불안정성을 유발할 수 있다.
- Advantage Combination
- — 다중 목표의 각 보상으로부터 얻은 이점을 독립적으로 정규화한 뒤 가중치를 합산하는 방법으로, 목표 간 상관관계를 무시할 수 있다.
- Variance-based weighting
- — 각 목표의 보상 분산을 이용해 가중치를 동적으로 조정하는 방법으로, 학습 신호의 강한 목표를 더 강조하고 약한 목표의 노이즈를 억제한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.