용어 해설
- Mixture-of-Experts
- — 여러 Expert 중 일부만 토큰마다 선택해 계산하는 구조입니다. 전체 파라미터는 크게 유지하면서 토큰당 활성 파라미터와 추론 연산량을 제한합니다. Expert 수를 늘리면 계산량을 비례적으로 늘리지 않고 모델 용량을 확장할 수 있습니다.
- Maximal Update Parameterization
- — 모델 폭이 커져도 파라미터 업데이트의 크기가 일관되도록 초기화와 학습률을 조정하는 방법입니다. 작은 Proxy 모델에서 찾은 최적 학습률을 더 큰 모델로 옮길 수 있게 만듭니다. 이 논문에서는 MoE의 폭과 Expert 수를 함께 확장하는 데 사용합니다.
- Multi-head Latent Attention
- — Attention의 Key-Value 정보를 저차원 잠재 공간으로 압축하는 구조입니다. 입력의 Key-Value 상태를 작은 표현으로 저장한 뒤 필요한 Attention 계산에 사용해 KV cache 메모리를 줄입니다. 이 논문에서는 모든 폭 확장 MoE 모델에 적용합니다.
- Muon optimizer
- — 신경망 가중치를 갱신하는 최적화 알고리즘으로, 논문에서는 기존 AdamW와 비교되는 학습 도구로 사용합니다. 각 학습 단계에서 gradient를 바탕으로 파라미터를 업데이트해 수렴을 돕습니다. MoE의 μP 기반 학습률 전이 실험에 사용됩니다.
- scaling law
- — 모델 크기나 학습 토큰 수의 변화와 성능 또는 최적 설정 사이의 관계를 수식으로 근사하는 방법입니다. 이 논문은 토큰 예산과 최적 learning rate의 관계를 log-log 선형 회귀로 적합합니다. 짧은 학습 구간의 결과로 10T-token 학습 설정을 추정하는 데 쓰입니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.