본문으로 건너뛰기

314B MoE 언어 모델 Motif 3의 구조와 학습 시스템

Motif 3는 GDLA, 384개 Routed Expert, MXFP8 학습 시스템을 결합해 토큰당 13.2B 파라미터만 활성화하면서 256K Token 문맥을 지원하는 314B MoE 언어 모델입니다.

왜 중요한가

Motif 3는 전체 314B 파라미터 중 토큰마다 약 13.2B만 활성화하는 Sparse Mixture-of-Experts 언어 모델로, 대규모 Expert 용량과 제한된 토큰별 계산을 함께 추구합니다. GDLA는 Differential Attention의 Noise 억제와 MLA의 압축 KV 표현을 결합하고, MXFP8 연산·통신과 256K Context Parallelism을 통해 대규모 학습 및 긴 문맥 처리를 지원합니다. 통제된 약 10B 파라미터 비교에서 GDLA는 MLA보다 9.2% 적은 Training Token으로 Loss 3.2에 도달했습니다.

핵심 기여

314B Sparse MoE 구조

각 Sparse MoE Layer에 Routed Expert 384개와 Shared Expert 1개를 배치하고, 토큰마다 Routed Expert 8개를 선택합니다. 전체 용량은 약 314B 파라미터지만 토큰별 활성화 파라미터는 약 13.2B로 제한됩니다.

GDLA Attention 설계

Grouped Differential Attention의 Signal·Noise 경로와 Multi-head Latent Attention의 압축 KV 상태를 하나의 Attention 구조로 결합합니다. Signal Query Head 64개와 Noise Query Head 16개를 사용하고, Noise 출력은 그룹별로 반복한 뒤 토큰별 계수로 감산합니다.

대규모 학습 안정화

FP32 Router 계산, Auxiliary-loss-free Expert Bias, Sequence-wise Load Balancing, Layer-adaptive Auxiliary Loss, Decaying Router Noise를 함께 사용합니다. Routing Collapse가 감지되면 불안정한 Layer의 Router Parameter와 Expert-selection Bias를 인접한 안정 Layer의 값으로 교체합니다.

저정밀·분산 학습 시스템

Expert Weight와 Activation에는 MXFP8을 선택적으로 적용하고, Gradient Synchronization은 BF16 통신과 FP32 로컬 Reduction을 결합합니다. FSDP Reduce-Scatter 중첩, Expert Weight All-Gather 제거, Fused Kernel, Optimizer State CPU Offloading으로 메모리와 통신 부담을 줄입니다.

통합 Post-training 파이프라인

General SFT 이후 13개 Verifier Domain에서 GRPO로 학습한 Specialist Teacher 6개와 SFT 기반 Software-engineering Teacher 1개를 구성합니다. Multi-teacher On-Policy Distillation으로 일곱 Teacher의 Reasoning, Coding, Tool Use, Long-context 이해 역량을 하나의 Student에 통합합니다}],

256K Long-context 학습

Full Attention에는 Ulysses를, Sliding-window Attention에는 Window-aware Ring Attention을 Layer별로 선택합니다. 128-token Window에서 Sliding-window 경로의 Rank-average KV 통신량은 분석상 L/(2W)=1,024배 줄고, Packed Document의 Attention Workload 차이는 Data-parallel 재배치로 완화됩니다.

핵심 아이디어 이해하기

일반적인 Self-Attention은 현재 토큰의 Query와 과거 토큰의 Key·Value를 비교해 문맥을 집계하지만, 관련 없는 문맥에도 Attention 확률을 배분할 수 있습니다. Differential Attention은 같은 입력에서 Signal 경로와 Noise 경로의 Attention 분포를 각각 계산한 뒤 Noise 성분을 빼서 공통으로 나타나는 패턴을 억제합니다. 동시에 MLA처럼 Key·Value 상태를 압축된 저차원 표현으로 저장하면 Autoregressive 추론에서 토큰마다 유지하는 KV cache를 줄일 수 있습니다.

GDLA는 이 두 아이디어를 결합하면서 Signal Head를 Noise Head보다 많이 둡니다. 총 Query Head가 80개이고 그룹 비율이 4이므로 Signal Head 64개와 Noise Head 16개를 구성하며, 각 Noise Head 출력을 네 개의 대응 Signal Head에 반복합니다. 토큰별 계수 [1mλt0˘01b[0m=σ(xtWλ)[1m\boldsymbol{\lambda}_{t}\u001b[0m=\sigma(\mathbf{x}_{t}\mathbf{W}^{\lambda})를 0과 1 사이로 제한한 뒤 Signal 출력에서 계수화한 Noise 출력을 빼므로 Noise를 억제하되 반전하거나 증폭하지 않습니다.

MoE에서는 모든 Expert를 매 토큰에 실행하지 않고 Router가 384개 Routed Expert 중 8개를 선택합니다. 입력 토큰이 Router를 거쳐 선택된 Expert로 전달되고, 각 Expert가 변환한 결과를 Routing Weight와 함께 결합해 다음 Transformer Block으로 보내므로 전체 파라미터는 약 314B로 유지하면서 토큰별 활성화 규모는 약 13.2B에 머뭅니다. Expert별 PolyNorm은 Routed Token 분포에 맞춰 서로 다른 Polynomial 계수와 Bias를 학습해 동일한 SiLU 반응을 강제하지 않습니다.

이런 구조를 실제 규모로 학습하려면 Expert Overload, Activation Outlier, 긴 문맥의 메모리와 통신이 병목이 됩니다. Motif 3는 Router Noise를 초기에 크게 넣고 Cosine 방식으로 줄여 Expert 탐색을 유도하며, mHC Post-Mapping 배율을 2에서 1로 낮춰 Residual Stream의 반복 증폭을 제한합니다. 또한 MXFP8 Grouped GEMM, 선택적 Activation Recomputation, 256K Context Parallelism을 입력·계산·통신 경로에 배치해 학습 시스템의 메모리 사용과 통신량을 관리합니다.

방법론

Motif 3는 53개 Transformer Layer로 구성된 Decoder-only Autoregressive MoE 모델입니다. 처음 2개 Layer는 Hidden Dimension 4,096과 FFN Dimension 12,288을 사용하는 Dense Block이고, 나머지 51개 Layer는 Routed Expert 384개와 Shared Expert 1개를 포함하는 Sparse MoE Block입니다. Attention은 GDLA를 사용하며 Full Causal Attention 1개 뒤에 Sliding-window Attention 3개를 반복하는 Hybrid Schedule과 최대 262,144 Token 문맥을 채택합니다.

GDLA의 Query 경로는 [1mctQ=RMSNorm(xtWaQ)[0m[1m\mathbf{c}^{Q}_{t}=\operatorname{RMSNorm}(\mathbf{x}_{t}\mathbf{W}^{Q}_{a})[0m로 입력 Hidden State를 압축한 뒤 Content Query와 Rotary Query로 확장합니다. KV 경로는 [1m[ctKV;ktR]=xtWaKV[0m[1m[\mathbf{c}^{KV}_{t};\mathbf{k}^{R}_{t}]=\mathbf{x}_{t}\mathbf{W}^{KV}_{a}[0m로 Compressed KV와 Decoupled Rotary Key를 만들고, Compressed KV를 한 번 RMSNorm한 뒤 16개 KV Head로 확장합니다. 두 Attention 경로가 같은 KV Head를 공유하면서 각각 Attention을 계산하고, [1mDt=HS,tλtRepeatg(HN,t)[0m[1m\mathbf{D}_{t}=\mathbf{H}_{S,t}-\boldsymbol{\lambda}_{t}\odot\operatorname{Repeat}_{g}(\mathbf{H}_{N,t})[0m로 Noise를 감산한 다음 Query 기반 Element-wise Gate와 Output Projection을 적용합니다.

Residual 연결은 4개의 병렬 Stream을 사용하는 수정된 mHC로 대체합니다. Pre-Mapping은 Sigmoid로 계산하고 Residual Mapping은 Sinkhorn-Knopp Normalization으로 Birkhoff Polytope에 투영해 음이 아닌 Doubly Stochastic Matrix를 만듭니다. Post-Mapping은 초기에는 2σ(Zpost)2\sigma(\mathbf{Z}_{post})로 시작하지만 Pretraining 중 배율을 2에서 1로 낮춰 Sublayer 출력이 깊은 Layer를 지나며 반복 증폭되는 현상을 완화합니다.

Expert 내부에서는 SiLU Gate 대신 Expert-Specific PolyNorm을 사용합니다. 입력 [1mz[0m[1m\mathbf{z}[0m의 각 원소에 1차부터 3차까지의 Polynomial을 적용하고 각 성분을 RMS로 정규화한 뒤 Expert별 계수와 Bias를 합산하며, 계수는 Sigmoid로 0과 1 사이에 두고 Bias는 -0.5와 0.5 사이로 Clip합니다. 학습 시스템은 Expert Parallelism 8과 Data Parallel Sharding을 계층적으로 배치하고, Expert Weight와 Activation을 MXFP8으로 처리하며, FP32 Master Weight·Main Gradient·Router Logit·Muon State를 고정밀도로 유지합니다.

주요 결과

약 10B 파라미터 규모의 통제 실험에서 GDLA의 Training Loss 곡선은 GDA와 MLA보다 낮게 유지됐습니다. GDLA는 MLA가 Loss 3.2에 도달하는 지점보다 9.2% 적은 Training Token으로 같은 Loss 3.2에 도달했습니다. 이 비교는 세 Attention 구조의 차이를 분리한 통제 조건에서 측정됐습니다.

Expert-Specific PolyNorm은 측정된 Layer 전반에서 SwiGLU보다 높은 Expert Gate Weight Effective Rank를 유지했습니다. Effective Rank는 Singular-value Energy가 여러 방향에 얼마나 고르게 분포하는지 나타내며, 측정된 Gate Matrix의 Rank가 512이므로 가능한 최대 Effective Rank도 512입니다. 따라서 PolyNorm 조건에서는 Gate Transformation이 더 넓은 활성 방향을 유지하는 패턴이 관찰됐습니다.

Decaying Router Noise를 적용한 조건에서는 Expert별 최대 Token Load가 Baseline보다 더 이른 시점에 Median-load 영역으로 내려왔습니다. 초기 Gaussian Noise가 Router 선택을 흔들어 더 많은 Expert가 Training Token을 받고, Noise를 점차 제거하면서 안정된 Routing 분포를 유지하는 순서입니다. 본문은 이 효과가 Pretraining 초기 단계에 집중된다고 기술합니다.

Motif 3는 약 12.5T Token으로 Pretraining됐고, 지식 Cutoff는 2026년 3월입니다. Tokenizer 비교 Probe에서 Motif Tokenizer는 English 5.68, Korean 5.31, Code 4.07, Mathematics 4.55 Bytes per Token으로 해당 Partition의 가장 높은 압축 수치를 기록했으며, 더 높은 Bytes per Token은 같은 텍스트를 더 적은 Token으로 표현한다는 뜻입니다. Post-training 이후 평가는 Long-horizon Agentic Task, Mathematical Reasoning, Scientific Knowledge, Hallucination-sensitive Evaluation 등에서 주요 Open-weight Model과 경쟁력 있는 결과를 기록했다고 본문에 적혀 있습니다.

관련 Figure

Training Token 수에 따른 Loss 곡선에서 GDLA, GDA, MLA를 비교한 그래프입니다.
Chart

그래프의 세 곡선은 Training Token이 약 13B에서 55B로 늘어날수록 Loss가 감소하는 흐름을 보입니다. GDLA 곡선은 주요 구간에서 GDA와 MLA보다 낮게 위치하며, Loss 3.2 수평선과 두 개의 수직 기준선 사이에 9.2% fewer tokens라는 주석이 있습니다. 이는 GDLA가 MLA와 같은 Loss 3.2에 더 적은 Training Token으로 도달한다는 본문의 통제 실험 결과와 직접 연결됩니다.

Training Token 수에 따른 Loss 곡선에서 GDLA, GDA, MLA를 비교한 그래프입니다.

Layer별 Expert Gate Weight의 Effective Rank를 Grouped PolyNorm과 SwiGLU 사이에서 비교한 선 그래프입니다.
Chart

Grouped PolyNorm 곡선은 Layer 2부터 15까지 대체로 SwiGLU 곡선보다 높은 Effective Rank를 유지합니다. Grouped PolyNorm의 값은 초기 Layer 2와 3에서 약 180과 187로 시작한 뒤 Layer 15에서 약 116으로 낮아지며, SwiGLU는 약 163에서 약 70으로 더 크게 낮아집니다. 본문에서 Effective Rank는 Singular-value Energy가 여러 방향에 고르게 분포하는 정도로 정의되므로, 이 차이는 PolyNorm Gate Weight가 더 넓은 활성 방향을 유지하는 결과와 연결됩니다.

Layer별 Expert Gate Weight의 Effective Rank를 Grouped PolyNorm과 SwiGLU 사이에서 비교한 선 그래프입니다.

Training Token에 따른 Expert별 최대 Token 수를 Baseline과 Router Noise 조건으로 비교한 그래프입니다.
Chart

초기 학습 구간에서 Baseline 곡선은 큰 변동과 높은 최대 Expert Load를 보이는 반면 Router Noise 곡선은 더 낮은 범위에서 움직입니다. 약 25B Token 전후에는 두 조건 모두 약 1.5M Token 부근의 Median 수준으로 가까워지고, 이후에는 그 주변에서 안정적으로 유지됩니다. 이는 Router Logit에 초기 Gaussian Noise를 넣고 Cosine 방식으로 감쇠해 초기 Expert 선택 고착을 줄인다는 본문의 설명과 일치합니다.

Training Token에 따른 Expert별 최대 Token 수를 Baseline과 Router Noise 조건으로 비교한 그래프입니다.

기술 상세

GDLA는 80 Query Head와 16 KV Head를 사용하며, 그중 Signal Query Head는 64개, Noise Query Head는 16개입니다. Query-Key Head Dimension은 192, Value Head Dimension은 128, Rotary Component는 64이며 Query·KV Low-rank Dimension은 각각 1,024와 512입니다. KV 경로는 Compressed KV를 16개 KV Head로 한 번 확장하고 Rotary Key를 모든 KV Head에 공유하므로 Signal·Noise 경로를 위해 별도 KV State를 유지하지 않습니다.

Grouped Differential Attention의 그룹 비율은 g=4g=4이고 전체 Query Head 수를 nHn_H라고 할 때 Noise Head 수는 nN=nH/(g+1)n_N=n_H/(g+1), Signal Head 수는 nS=gnNn_S=gn_N으로 정합니다. 각 Signal Head는 같은 그룹의 Noise Head 출력과 짝을 이루며, 입력 Hidden State에서 계산한 [1mλt0˘01b[0m[1m\boldsymbol{\lambda}_{t}\u001b[0m가 감산 크기를 조절합니다. Sigmoid 출력이 0과 1 사이이므로 [1mDt[0m[1m\mathbf{D}_{t}[0m는 Signal Attention을 유지하면서 Noise Attention을 부분적으로 제거하는 방향으로만 변합니다.

MoE 학습에서는 Activation을 Expert Dispatch 이전에 한 번 MXFP8으로 양자화합니다. 이 순서로 인해 Dispatch 통신도 MXFP8을 사용하고, Top-k가 8일 때 Expert별로 따로 양자화하는 방식보다 양자화 비용이 8분의 1로 줄어듭니다. Gradient Synchronization은 BF16 Shard를 전송한 뒤 각 Rank에서 FP32로 합산하며, Row-wise MXFP8 Weight만 All-Gather하고 Column-wise Weight는 Fused Row-to-Column Transcode로 로컬 생성합니다.

256K Token 학습에서는 Full Attention의 계산량이 [1mΘ(L2)[0m[1m\Theta(L^{2})[0m, Sliding-window Attention의 계산량이 [1mΘ(LW)[0m[1m\Theta(LW)[0m이므로 두 경로에 같은 Context Parallel Algorithm을 적용하지 않습니다. Full Attention에는 Head와 Sequence Dimension을 All-to-All로 전치하는 Ulysses를 적용하고, Sliding-window Layer에는 인접 Rank에서 Window 길이 WW만 Halo Exchange하는 Window-aware Ring Attention을 적용합니다. W=128W=128인 설정에서 Window-aware Ring의 Rank-average 수신 KV Volume은 [1mΘ(L)0˘01b[0m[1m\Theta(L)\u001b[0m에서 [1mΘ(W)0˘01b[0m[1m\Theta(W)\u001b[0m로 낮아지고, 본문은 분석상 1,024배의 감소를 제시합니다.

관련 Figure

FSDP Weight Path, Forward, Backward, Gradient Sync 및 Optimizer 과정을 정밀도별로 연결한 시스템 다이어그램입니다.
Diagram

Weight Path에서는 Weight Shard가 Rowwise MXFP8 Weight로 양자화되고, All-Gather와 Row-to-Column MXFP8 Transcode를 거쳐 Forward와 Backward에 사용됩니다. Forward에서는 Expert Input Activation을 MXFP8으로 양자화한 뒤 Expert Parallel Dispatch All-to-All과 Grouped GEMM을 수행하며, Gradient Sync에서는 BF16 통신과 FP32 Local Sum을 조합합니다. 이 흐름은 Expert 계산·통신에는 MXFP8을 선택적으로 적용하고 Main Gradients와 Muon Optimizer States는 FP32로 유지한다는 저정밀 학습 설계를 시각화합니다.

FSDP Weight Path, Forward, Backward, Gradient Sync 및 Optimizer 과정을 정밀도별로 연결한 시스템 다이어그램입니다.

행렬 형태의 선형 구조, 색상별 막대 구성, 두 개의 비교 곡선을 나란히 배치한 세 패널 기술 도표입니다.
Other

왼쪽 패널은 대각선과 확대 영역을 포함한 행렬 구조를, 가운데 패널은 색상별 구성 요소의 상대적 크기를, 오른쪽 패널은 두 변수의 변화 곡선을 나타냅니다. 제공된 본문에는 이 파일의 Figure Caption이나 특정 실험 변수명이 없어 각 패널을 특정 기법의 결과로 단정할 근거가 없습니다. 따라서 세부 수치보다 구조적 비교와 변화 추세를 확인하는 보조 기술 도표로만 연결할 수 있습니다.

행렬 형태의 선형 구조, 색상별 막대 구성, 두 개의 비교 곡선을 나란히 배치한 세 패널 기술 도표입니다.

실무 활용

Motif 3는 대규모 Expert 용량을 유지하면서 토큰별 활성화량을 제한하는 MoE 언어 모델이므로 Reasoning, Coding, Tool Use, Long-context 처리처럼 여러 능력을 하나의 모델에서 요구하는 작업에 활용할 근거가 있습니다. 256K Token 문맥과 Self-speculative Decoding을 위한 Multi-token Prediction Head도 포함되어 있어 긴 입력과 추론 단계의 Draft 생성에 연결됩니다.

  • 256K Token까지 이어지는 긴 문서의 질의응답과 문맥 추론
  • 수학·과학·법률·금융 자료를 활용하는 전문 Reasoning
  • Software Engineering과 Code Generation
  • Tool Use와 Long-horizon Agentic Task
  • Self-speculative Decoding을 활용한 Autoregressive 추론

코드 공개 여부: 미확인

키워드

Mixture-of-Experts(전문가 혼합)Grouped Differential Latent Attention(그룹화 차분 잠재 Attention)Expert-Specific PolyNorm(Expert별 다항 정규화)MXFP8(저정밀 부동소수점 형식)Long-context Training(긴 문맥 학습)Multi-teacher On-Policy Distillation(다중 Teacher On-Policy Distillation)

용어 해설

Mixture-of-Experts
하나의 대형 신경망을 여러 Expert로 나누고 Router가 입력 토큰마다 일부 Expert만 선택하는 구조입니다. 전체 파라미터 용량은 크게 유지하면서 토큰별 계산량을 제한할 수 있어, 희소성을 활용한 대규모 언어 모델 학습에 중요합니다.
Grouped Differential Attention
Signal Attention과 Noise Attention의 출력을 계산한 뒤 입력에 따라 정한 계수로 Noise 경로를 빼는 Attention 방식입니다. Signal head를 더 많이 배치하고 Noise head를 여러 Signal head에 공유해 선택성을 유지하면서 추가 계산량을 줄입니다.
Multi-head Latent Attention
Key와 Value 상태를 저차원 latent 표현으로 압축해 Autoregressive 추론에서 저장해야 하는 KV cache를 줄이는 Attention 구조입니다. Motif 3에서는 이 압축 표현을 한 번 정규화하고 여러 KV head로 확장해 Signal·Noise 경로가 공유합니다.
manifold-constrained hyper-connections
하나의 Residual Stream 대신 여러 병렬 Stream을 두고, 토큰별 Mapping으로 정보를 축소·변환·재분배하는 연결 구조입니다. Residual Mapping을 Birkhoff polytope에 제약해 행과 열의 합을 1로 유지하며, Motif 3은 Post-Mapping 배율을 2에서 1로 점진적으로 낮춰 Activation Outlier 누적을 억제합니다.
Expert별 PolyNorm 활성화(Expert-Specific PolyNorm)
각 Expert가 서로 다른 1차·2차·3차 Polynomial 계수와 Bias를 학습하는 활성화 함수입니다. 각 Polynomial 성분을 RMS로 정규화하고 계수와 Bias 범위를 제한해 Expert별 비선형 반응을 허용하면서 과도한 Activation 증가를 줄입니다.
Router Noise(router noise)
초기 학습에서 Router Logit에 Gaussian Noise를 더해 특정 Expert로 선택이 고착되는 현상을 늦추는 기법입니다. Noise 크기를 Cosine Schedule로 점차 낮추므로 초기에는 Expert 탐색을 넓히고 이후에는 형성된 Routing 패턴을 안정적으로 유지합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 10.수집 2026. 08. 12.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.