본문으로 건너뛰기

Mixture-of-Experts(MoE) 모델은 활성화되는 파라미터보다 훨씬 더 많은 파라미터를 보유한다

MoE는 라우터가 토큰별로 소수의 전문가를 선택해 용량을 확장하면서 토큰당 연산을 제한하며, 35B 멀티모달 MoE를 네 대의 A100에서 미세조정할 때의 샤딩 실패와 해결 및 라우팅 감사 결과를 보고한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

대규모 밀집 모델은 토큰마다 동일한 FFN 용량을 사용하므로 연산·메모리 비용이 토큰 단위로 증가하는 한계가 발생했고, Mixture-of-Experts 아키텍처는 이를 라우터가 각 토큰에 대해 소수의 전문가만 선택해 실행하는 조건부 연산으로 해결한다. 본문은 MoE의 라우팅 메커니즘과 전문가 특수화가 학습 중에 자연스럽게 형성되는 과정을 설명하고, 350억 파라미터 멀티모달 MoE를 네 대의 A100 GPU에서 미세조정하는 과정에서 다섯 가지 샤딩 방식이 실패하고 이후 작동한 접근법을 찾아낸 실무적 경험을 보고한다. 또한 레이어별 라우팅 감사를 통해 오디오·비디오·텍스트 모달리티 사이의 용량 배분 양상을 관찰함으로써 분산 샤딩과 라우터 설계가 MoE 성능과 효율에 결정적인 영향을 미친다는 한계와 교훈을 제시한다.

섹션별 상세

01
대규모 모델의 밀집적(dense) 확장은 토큰마다 동일한 FFN 용량을 사용하므로 연산·메모리·에너지 비용이 토큰당 직접 증가하는 문제가 발생했다. Mixture-of-Experts 아키텍처에서는 단일 FFN을 다수의 전문가 FFN과 학습 가능한 라우터로 대체하여 입력 표현에 따라 소수의 전문가만 활성화하는 방식으로 이를 해결한다. 라우터는 입력에 선형 변환을 적용한 뒤 softmax 결과에서 top-k 전문가를 선택하고 선택된 전문가들의 출력을 가중합해 최종 출력을 만든다. 이 구조는 토큰당 활성 연산을 제한하면서 모델 전체의 파라미터 용량을 크게 키울 수 있는 수단을 제공한다.
왼쪽에는 모든 토큰이 동일한 FFN을 통과하는 dense FFN 구조가 있고 오른쪽에는 라우터가 토큰별로 소수의 전문가를 선택해 실행하는 MoE FFN의 흐름을 비교한 다이어그램이 제시되어 있다.
Diagram다이어그램은 dense 구조에서는 입력 토큰들이 공유 FFN을 통과해 동일한 출력을 얻는 반면 MoE 구조에서는 라우터가 각 토큰에 대해 top-k 전문가를 선택하고 선택된 전문가 출력의 가중합을 통해 최종 출력을 만든다는 처리를 시각적으로 보여준다. 이 그림은 조건부 연산(conditional computation)과 라우터 기반의 토큰별 경로 분기, 그리고 선택되지 않은 전문가들이 비활성 상태로 남는 점을 강조하여 MoE의 핵심 작동 원리와 토큰당 연산 절감 효과를 직관적으로 전달한다.
02
실험적으로 연구진은 350억 파라미터 규모의 멀티모달 MoE를 네 대의 A100 GPU에서 미세조정하려 했고, 초기에는 다섯 가지 샤딩 접근법이 모두 실패한 경험을 보고했다. 실패 원인으로는 전문가 파라미터 분배와 통신·메모리 병목이 복합적으로 작용한 점이 지목되었고, 최종적으로 작동한 방법과 실패했던 접근법의 차이를 기술적으로 제시했다. 또한 각 레이어별 라우팅 감사를 통해 오디오·비디오·텍스트 모달리티 사이에 모델 용량이 어떻게 배분되는지 관찰한 결과를 제시했다. 이러한 실무적 경험은 MoE를 분산 환경에서 운용할 때 샤딩 전략과 라우터 동작을 면밀히 설계해야 함을 보여준다.
03
라우터와 전문가 간의 특수화(specialization)는 설계로 고정되는 것이 아니라 학습 과정에서 자연스럽게 형성되는 경향이 관찰되었다. 학습 중에 라우터는 입력 특성에 따라 특정 전문가들을 반복적으로 선택함으로써 전문가별로 특정 모달리티나 패턴에 특화되는 분포가 생기며, 그 결과 모델 내부의 용량 할당이 데이터와 손실 함수의 제약에 의해 동적으로 재편된다. 레이어 단위의 라우팅 분석은 이러한 특화가 층마다 다르게 나타나며 멀티모달 처리에서 특정 층이 특정 모달리티를 더 많이 전담하는 양상을 드러냈다. 이 관찰은 MoE 모델의 해석과 샤딩·로드밸런싱 전략 수립에 직접적인 근거를 제공한다.

용어 해설

라우터(Router)
라우터는 입력 토큰의 표현을 받아 전문가(expert)들 가운데 소수만을 선택하도록 확률 분포를 산출하는 학습 가능한 모듈로, 입력벡터에 선형 변환을 적용한 뒤 softmax로 가중치 g를 계산하고 top-k 선택으로 해당 전문가들의 출력만 활성화한다.
조건부 연산(Conditional Computation)
조건부 연산은 모든 파라미터를 매번 활성화하지 않고 입력에 따라 일부 경로만 실행하는 방식으로, Mixture-of-Experts 구조에서는 라우터가 선택한 소수의 expert만 가동하여 토큰당 실제 계산량을 제한하면서 전체 모델 용량을 크게 늘릴 수 있게 한다.
피드포워드 네트워크(Feed-Forward Network (FFN))
Transformer 내부의 FFN은 각 토큰별로 적용되는 완전연결 계층의 집합으로, MoE 아키텍처에서는 단일 FFN을 여러 개의 전문가 FFN로 대체하여 토큰별로 서로 다른 FFN을 선택해 실행함으로써 용량을 확장한다.
샤딩(Sharding)
샤딩은 대규모 모델이나 데이터셋을 여러 장치에 분산 배치하는 기법으로, MoE 모델에서는 전문가 파라미터와 활성화된 계산을 효율적으로 분배하는 방식이 중요한데 부적절한 샤딩 전략은 메모리·통신 병목과 연산 실패를 초래할 수 있다.

기술

  • Transformer
  • MoE
  • A100 GPU

활용 사례

  • 모델 용량을 크게 늘리면서 토큰당 연산을 억제하는 대규모 언어·멀티모달 모델
  • 오디오·비디오·텍스트 병합 처리에서 모달리티별 용량 할당을 관찰하는 연구
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 23.수집 2026. 07. 23.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.