용어 해설
- 어드밴티지 추정기(Advantage estimator)
- — 정책경사 강화학습에서 각 행동의 가치 기여도를 계산하는 함수로, 에피소드 전체 보상이나 상태·행동별 보상 등을 이용해 신호를 생성한다. 이 논문 맥락에서는 episode-level, step-level, transition-level로 구분되어 각 방식이 업데이트 스펙트럼과 SNR에 다른 영향을 미친다. 어드밴티지 설계는 Muon 적용 시 학습 안정성과 이득 발생 여부를 결정하는 핵심 요소로 작용했다.
- 스텝 레벨 크레딧(Step-level credit)
- — 동일한 앵커 상태에서 취한 행동들을 그룹화하여 각 행동에 할당하는 시점별 보상 신호로, 에피소드 단위 보상보다 더 국지적인 신호를 제공한다. GiGPO의 핵심 구성요소로 작동하여 반복 관찰된 상태 간 대비를 만들어 gradient 스펙트럼의 약한 방향에서 신호를 개선할 가능성이 제기됐다. 본 논문 실험에서는 step-level credit의 유무가 Muon의 효과 크기에 영향을 미치는 것으로 확인됐다.
- 뉴턴-슐츠 반복(Newton–Schulz)
- — 행렬의 정규화 또는 역근사에 쓰이는 반복 알고리즘으로, Muon은 이 반복을 이용해 모멘텀 행렬의 극분해 근사에서 극좌표(P = UV^T)만 남긴다. Muon은 다수의 NS 반복(논문에서 5회)을 적용하여 singular-value 정보를 제거하고 방향성만 보존하는 업데이트를 생성했다. 이 과정은 업데이트의 스펙트럼을 평탄화하여 약한 방향을 상대적으로 증폭시키는 역할을 했다.
- 스펙트럼 평탄화(Spectral flattening)
- — 행렬 업데이트에서 특이값의 크기 차이를 줄여 주된 방향과 약한 방향 간 격차를 좁히는 연산을 의미한다. Muon은 singular-value를 제거하고 UV^T 형태로 업데이트를 적용하여 스펙트럼 평탄화를 수행했고, 이로 인해 잡음 우세 방향의 상대적 증폭이 발생할 수 있음이 논의되었다. 평탄화가 유효하려면 약한 방향의 부호가 신뢰할 만해야 한다는 수리적 조건이 제기됐다.
- 그래디언트 신호대잡음비(Gradient SNR)
- — 샘플링 잡음과 실제 정책 신호 간의 비율로, 값이 클수록 유효한 업데이트 방향이 잡음에 비해 뚜렷하다. 논문은 Muon의 효과가 이 비율에 의존할 수 있다고 가정했고, 단일턴 RLVR에서 실패 보고와 장기간 에이전트 환경에서의 성공 사례를 이 가설로 연결했다. 실험은 SNR을 직접 측정하지는 않았으므로 가설로 남아 있다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


