본문으로 건너뛰기

대규모 MoE 학습률을 단계적으로 확장하는 방법

μP와 token scaling law로 작은 MoE proxy의 learning rate를 10T-token 학습까지 전이했습니다.

용어 해설

Mixture-of-Experts
여러 Expert 중 일부만 토큰마다 선택해 계산하는 구조입니다. 전체 파라미터는 크게 유지하면서 토큰당 활성 파라미터와 추론 연산량을 제한합니다. Expert 수를 늘리면 계산량을 비례적으로 늘리지 않고 모델 용량을 확장할 수 있습니다.
Maximal Update Parameterization
모델 폭이 커져도 파라미터 업데이트의 크기가 일관되도록 초기화와 학습률을 조정하는 방법입니다. 작은 Proxy 모델에서 찾은 최적 학습률을 더 큰 모델로 옮길 수 있게 만듭니다. 이 논문에서는 MoE의 폭과 Expert 수를 함께 확장하는 데 사용합니다.
Multi-head Latent Attention
Attention의 Key-Value 정보를 저차원 잠재 공간으로 압축하는 구조입니다. 입력의 Key-Value 상태를 작은 표현으로 저장한 뒤 필요한 Attention 계산에 사용해 KV cache 메모리를 줄입니다. 이 논문에서는 모든 폭 확장 MoE 모델에 적용합니다.
Muon optimizer
신경망 가중치를 갱신하는 최적화 알고리즘으로, 논문에서는 기존 AdamW와 비교되는 학습 도구로 사용합니다. 각 학습 단계에서 gradient를 바탕으로 파라미터를 업데이트해 수렴을 돕습니다. MoE의 μP 기반 학습률 전이 실험에 사용됩니다.
scaling law
모델 크기나 학습 토큰 수의 변화와 성능 또는 최적 설정 사이의 관계를 수식으로 근사하는 방법입니다. 이 논문은 토큰 예산과 최적 learning rate의 관계를 log-log 선형 회귀로 적합합니다. 짧은 학습 구간의 결과로 10T-token 학습 설정을 추정하는 데 쓰입니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 20.수집 2026. 08. 25.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.