용어 해설
- 시간적 신용 할당(Temporal Credit Assignment)
- — 강화학습에서 다른 할인 인자 γ를 가진 가치(heads)들의 상호 비교를 통해 올바른 시점의 보상을 정책 개선에 반영하는 문제를 말한다. 본 논문은 다중 타임스케일 예측을 액터에 라우팅하는 디자인의 한계에 주목한다.
- 대리 목표 해킹(Surrogate Objective Hacking)
- — differentiable router가 PPO surrogate 내부에서 수치적으로 유리한 헤드를 선택하도록 직접 기여하는 현상이어서, 물리적 제어와의 개선과 매개 변수의 변화가 일치하지 않는다.
- 스케일 불일치(Scale Discrepancy)
- — 다양한 discount factor γ가 서로 다른 효과적 수평선과 크기를 가지므로 헤드 간 예측값의 스케일 차이가 라우팅 결정에 영향을 준다.
- 시간 불확실성의 역설(Paradox of Temporal Uncertainty)
- — 에러 기반 라우팅에서 예측 오차가 더 작은 단기 헤드가 더 큰 가중치를 얻는 경향이 생겨, DELAY된 목표와의 정합성보다 오차의 용이성에 의해 결정될 수 있다.
- 타깃 디커플링(Target Decoupling)
- — 액터는 장기 헤드의 이점을 사용하도록 라우팅 경로를 제거하고, 크리틱은 단기 헤드를 보조로 남겨 학습을 정규화하는 구조적 분리 원리이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


