본문으로 건너뛰기

너비-깊이 동시 확장을 위한 µP의 스펙트럼 조건

기존의 µP는 모델의 너비 확장에만 최적화되어 있어, 현대적인 거대 모델처럼 깊이를 함께 늘릴 때 학습이 불안정해지는 한계가 있었다. 이 논문은 선형 대수 기반의 단순한 '스펙트럼 조건'을 통해 어떤 옵티마이저를 쓰더라도 너비와 깊이에 상관없이 안정적인 학습과 하이퍼파라미터 전이를 가능하게 하는 통합 공식을 제공한다.

용어 해설

최대 업데이트 파라미터화(µP)
모델의 너비가 무한히 커지는 극한 상황에서도 특징 학습의 동역학을 일정하게 유지하도록 하이퍼파라미터를 스케일링하는 기법이다. 작은 모델에서 최적화된 학습률을 거대 모델에 재튜닝 없이 전이할 수 있게 하여 학습 비용을 획기적으로 줄여준다.
RMS 연산자 노름(RMS Operator Norm)
행렬이 입력 벡터의 RMS(Root Mean Square) 크기를 얼마나 변화시키는지를 측정하는 지표이다. 모델의 각 층을 통과할 때 데이터의 스케일이 어떻게 변하는지 분석하는 핵심 도구로, 학습 안정성 확보를 위한 스케일링 조건 설정에 사용된다.
잔차 네트워크(Residual Network)
입력 데이터를 다음 층으로 직접 전달하는 지름길(Skip Connection)을 추가하여 층이 깊어져도 그래디언트 소실 문제를 완화하는 아키텍처이다. 현대적인 Transformer 구조의 근간이 되며, 본 논문에서는 이 구조에서의 깊이 확장을 집중적으로 다룬다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 28.수집 2026. 03. 04.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.