섹션별 상세
Llama4 Scout 모델 학습에서 MXFP8을 적용해 bfloat16 대비 30.2%의 속도 향상을 달성했으며, 3,000 스텝 이상의 실험에서 두 방식의 손실 곡선이 거의 일치함을 확인했다.

핵심 기술인 _to_mxfp8_then_scaled_grouped_mm API는 입력 활성화 함수와 가중치를 MXFP8로 동적 양자화한 후 스케일링된 Grouped GEMM을 수행하며, 이는 기존 bfloat16 대비 최대 1.8배 빠른 속도를 제공한다.

Blackwell GPU의 5세대 Tensor Core(tcgen05)를 활용하기 위해 스케일 팩터를 특수한 블록 레이아웃(128x4 타일)으로 변환하는 커널을 구현하여 하드웨어 가속 성능을 최적화했다.


MoE의 순전파(Forward)와 역전파(Backward) 과정에서 동적 양자화가 적용되며, 특히 가중치 그래디언트 계산 시에는 수축 차원(Contracting Dimension)에 따른 복잡한 레이아웃 변환을 처리한다.

실험 결과, 출력 임베딩 투영이나 특정 Attention 레이어(Wk, Wv)는 저정밀도에 민감하거나 연산 규모가 작아 MXFP8 적용 대상에서 제외하는 것이 성능과 수렴 안정성 측면에서 유리하다.
기술
- TorchAO
- TorchTitan
- MXFP8
- PyTorch
- Blackwell Tensor Cores
활용 사례
- Llama4 Scout 학습 가속화
- 대규모 MoE 모델의 효율적 학습
- 저정밀도 동적 양자화 적용
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 13.수집 2026. 03. 13.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.