본문으로 건너뛰기

Representation over Routing: 다중 타임스케일 PPO에서의 시간적 라우팅 병리 진단

다중 타임스케일로 가치 예측을 수행하되 actor 업데이트에 라우팅을 직접 포함시키면 surrogate objective를 악용할 수 있는 경로가 생긴다. differentiable router는 현재 업데이트에 유리한 헤드를 선택하도록 기여할 수 있으며, 헤드 간 스케일 차이로 인해 실제 제어와의 정합성이 손상될 수 있다. LunarLander-v2에서 Surrogate Objective Hacking과 Paradox of Temporal Uncertainty를 확인하고, Target Decoupling으로 구조적 분리를 제시한다. 이로써 다중-헤드 크리틱의 안정성과 해석 가능성을 진단하는 프레임워크를 제공한다.

용어 해설

시간적 신용 할당(Temporal Credit Assignment)
강화학습에서 다른 할인 인자 γ를 가진 가치(heads)들의 상호 비교를 통해 올바른 시점의 보상을 정책 개선에 반영하는 문제를 말한다. 본 논문은 다중 타임스케일 예측을 액터에 라우팅하는 디자인의 한계에 주목한다.
대리 목표 해킹(Surrogate Objective Hacking)
differentiable router가 PPO surrogate 내부에서 수치적으로 유리한 헤드를 선택하도록 직접 기여하는 현상이어서, 물리적 제어와의 개선과 매개 변수의 변화가 일치하지 않는다.
스케일 불일치(Scale Discrepancy)
다양한 discount factor γ가 서로 다른 효과적 수평선과 크기를 가지므로 헤드 간 예측값의 스케일 차이가 라우팅 결정에 영향을 준다.
시간 불확실성의 역설(Paradox of Temporal Uncertainty)
에러 기반 라우팅에서 예측 오차가 더 작은 단기 헤드가 더 큰 가중치를 얻는 경향이 생겨, DELAY된 목표와의 정합성보다 오차의 용이성에 의해 결정될 수 있다.
타깃 디커플링(Target Decoupling)
액터는 장기 헤드의 이점을 사용하도록 라우팅 경로를 제거하고, 크리틱은 단기 헤드를 보조로 남겨 학습을 정규화하는 구조적 분리 원리이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 21.수집 2026. 05. 27.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.