TL;DR
대규모 밀집 모델은 토큰마다 동일한 FFN 용량을 사용하므로 연산·메모리 비용이 토큰 단위로 증가하는 한계가 발생했고, Mixture-of-Experts 아키텍처는 이를 라우터가 각 토큰에 대해 소수의 전문가만 선택해 실행하는 조건부 연산으로 해결한다. 본문은 MoE의 라우팅 메커니즘과 전문가 특수화가 학습 중에 자연스럽게 형성되는 과정을 설명하고, 350억 파라미터 멀티모달 MoE를 네 대의 A100 GPU에서 미세조정하는 과정에서 다섯 가지 샤딩 방식이 실패하고 이후 작동한 접근법을 찾아낸 실무적 경험을 보고한다. 또한 레이어별 라우팅 감사를 통해 오디오·비디오·텍스트 모달리티 사이의 용량 배분 양상을 관찰함으로써 분산 샤딩과 라우터 설계가 MoE 성능과 효율에 결정적인 영향을 미친다는 한계와 교훈을 제시한다.
섹션별 상세

- 연구진은 35-billion-parameter 멀티모달 MoE를 네 대의 A100 GPU에서 미세조정하려 했고, 처음 시도한 다섯 가지 샤딩 접근법이 모두 실패했으나 이후 작동하는 접근법을 찾아냈다. — 본문 두 번째 부분의 실험 보고 문단(미세조정 시도 및 샤딩 접근법 설명)
- 레이어별 라우팅 감사는 오디오·비디오·텍스트 모달리티 사이에 모델 용량이 비균등하게 배분되는 양상을 드러냈다. — 본문 두 번째 부분의 'layer-by-layer routing audit' 결과 언급
용어 해설
- Router
- — 라우터는 입력 토큰의 표현을 받아 전문가(expert)들 가운데 소수만을 선택하도록 확률 분포를 산출하는 학습 가능한 모듈로, 입력벡터에 선형 변환을 적용한 뒤 softmax로 가중치 g를 계산하고 top-k 선택으로 해당 전문가들의 출력만 활성화한다.
- Conditional Computation
- — 조건부 연산은 모든 파라미터를 매번 활성화하지 않고 입력에 따라 일부 경로만 실행하는 방식으로, Mixture-of-Experts 구조에서는 라우터가 선택한 소수의 expert만 가동하여 토큰당 실제 계산량을 제한하면서 전체 모델 용량을 크게 늘릴 수 있게 한다.
- Feed-Forward Network (FFN)
- — Transformer 내부의 FFN은 각 토큰별로 적용되는 완전연결 계층의 집합으로, MoE 아키텍처에서는 단일 FFN을 여러 개의 전문가 FFN로 대체하여 토큰별로 서로 다른 FFN을 선택해 실행함으로써 용량을 확장한다.
- Sharding
- — 샤딩은 대규모 모델이나 데이터셋을 여러 장치에 분산 배치하는 기법으로, MoE 모델에서는 전문가 파라미터와 활성화된 계산을 효율적으로 분배하는 방식이 중요한데 부적절한 샤딩 전략은 메모리·통신 병목과 연산 실패를 초래할 수 있다.
기술
- Transformer
- MoE
- A100 GPU
활용 사례
- 모델 용량을 크게 늘리면서 토큰당 연산을 억제하는 대규모 언어·멀티모달 모델
- 오디오·비디오·텍스트 병합 처리에서 모달리티별 용량 할당을 관찰하는 연구
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.