본문으로 건너뛰기
HF Daily Papers조회 1

Muon이 에이전트형 강화학습에 유용한 경우

GiGPO 환경에서 Muon을 정책의 숨겨진 행렬 파라미터에 적용하자 최종 윈도우 검증 성공률이 평균 0.29에서 0.55로 증가했고 학습 효율도 개선됐다.

용어 해설

어드밴티지 추정기(Advantage estimator)
정책경사 강화학습에서 각 행동의 가치 기여도를 계산하는 함수로, 에피소드 전체 보상이나 상태·행동별 보상 등을 이용해 신호를 생성한다. 이 논문 맥락에서는 episode-level, step-level, transition-level로 구분되어 각 방식이 업데이트 스펙트럼과 SNR에 다른 영향을 미친다. 어드밴티지 설계는 Muon 적용 시 학습 안정성과 이득 발생 여부를 결정하는 핵심 요소로 작용했다.
스텝 레벨 크레딧(Step-level credit)
동일한 앵커 상태에서 취한 행동들을 그룹화하여 각 행동에 할당하는 시점별 보상 신호로, 에피소드 단위 보상보다 더 국지적인 신호를 제공한다. GiGPO의 핵심 구성요소로 작동하여 반복 관찰된 상태 간 대비를 만들어 gradient 스펙트럼의 약한 방향에서 신호를 개선할 가능성이 제기됐다. 본 논문 실험에서는 step-level credit의 유무가 Muon의 효과 크기에 영향을 미치는 것으로 확인됐다.
뉴턴-슐츠 반복(Newton–Schulz)
행렬의 정규화 또는 역근사에 쓰이는 반복 알고리즘으로, Muon은 이 반복을 이용해 모멘텀 행렬의 극분해 근사에서 극좌표(P = UV^T)만 남긴다. Muon은 다수의 NS 반복(논문에서 5회)을 적용하여 singular-value 정보를 제거하고 방향성만 보존하는 업데이트를 생성했다. 이 과정은 업데이트의 스펙트럼을 평탄화하여 약한 방향을 상대적으로 증폭시키는 역할을 했다.
스펙트럼 평탄화(Spectral flattening)
행렬 업데이트에서 특이값의 크기 차이를 줄여 주된 방향과 약한 방향 간 격차를 좁히는 연산을 의미한다. Muon은 singular-value를 제거하고 UV^T 형태로 업데이트를 적용하여 스펙트럼 평탄화를 수행했고, 이로 인해 잡음 우세 방향의 상대적 증폭이 발생할 수 있음이 논의되었다. 평탄화가 유효하려면 약한 방향의 부호가 신뢰할 만해야 한다는 수리적 조건이 제기됐다.
그래디언트 신호대잡음비(Gradient SNR)
샘플링 잡음과 실제 정책 신호 간의 비율로, 값이 클수록 유효한 업데이트 방향이 잡음에 비해 뚜렷하다. 논문은 Muon의 효과가 이 비율에 의존할 수 있다고 가정했고, 단일턴 RLVR에서 실패 보고와 장기간 에이전트 환경에서의 성공 사례를 이 가설로 연결했다. 실험은 SNR을 직접 측정하지는 않았으므로 가설로 남아 있다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 17.수집 2026. 07. 21.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.