어드밴티지 추정기
정책경사 강화학습에서 각 행동의 가치 기여도를 계산하는 함수로, 에피소드 전체 보상이나 상태·행동별 보상 등을 이용해 신호를 생성한다. 이 논문 맥락에서는 episode-level, step-level, transition-level로 구분되어 각 방식이 업데이트 스펙트럼과 SNR에 다른 영향을 미친다. 어드밴티지 설계는 Muon 적용 시 학습 안정성과 이득 발생 여부를 결정하는 핵심 요소로 작용했다.