본문으로 건너뛰기

Unbounded Positive Asymmetric Optimization(UP): 중요도 샘플링 기반 RL의 탐색-안정성 딜레마 해소

UP는 정책을 stop-gradient로 고정하고 양의 이득에 대해 비클리핑 그라디언트를 허용하는 비대칭 최적화를 도입해 중요도 샘플링에서 발생하던 탐색 제약을 완화하고 DAPO·GSPO·GRPO 등에서 추론 정확도를 개선했다.

용어 해설

중요도 샘플링(Importance Sampling)
행동 정책으로부터 수집한 데이터를 목표 정책 업데이트에 재사용할 때 확률비(ratio)를 사용해 표본의 기여도를 재가중하는 기법으로, 오프정책 데이터 효율성을 높이지만 확률비 분산으로 학습 불안정성이 발생할 수 있어 안정화 기법이 필요하다.
확률 용량(Probability Capacity)
정책이 업데이트에 할당할 수 있는 '확률 질량'의 예산을 정형화한 개념으로, 보수적 클리핑은 이 예산을 조기에 소진시켜 정답이지만 낮은 신뢰도의 추론 경로에 대해 충분한 업데이트를 발생시키지 못하게 하는 구조적 제약을 의미한다.
스톱 그래디언트 연산자(Stop-Gradient)
역전파 시 특정 신호의 그래디언트 전달을 차단하여 파라미터의 일부를 고정시킨 채 다른 요소만 학습시키는 연산으로, 본 논문에서는 정책을 현재 상태에 고정해 양의 이득에 대한 그라디언트를 비제한으로 흐르게 하는 데 사용된다.
비대칭 최적화(Asymmetric Optimization)
같은 이득 신호라도 부호에 따라 서로 다르게 처리하는 최적화 설계로, 본문 맥락에서는 양의 이득은 클리핑 없이 유지하여 탐색을 촉진하고 음의 이득은 클리핑으로 제어해 학습 불안정을 억제하는 전략을 가리킨다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 08.수집 2026. 07. 11.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.