섹션별 상세
NVIDIA Blackwell(B200) GPU의 5세대 텐서 코어는 MXFP8 형식을 네이티브로 지원하여 BF16 대비 이론상 최대 2배의 TFLOPS를 제공한다. TorchAO를 통해 DeepSeek-V3의 그룹화된 행렬 곱셈(Grouped GEMM)에 MXFP8을 적용함으로써 연산 집약적인 전문가 레이어의 처리 속도를 가속화했다. 이 과정에서 32개 요소 단위의 미세 스케일링을 적용해 수치적 정밀도 손실을 최소화했다.

MoE 모델의 핵심 병목인 All-to-All 통신을 최적화하기 위해 DeepSeek에서 개발한 DeepEP 라이브러리를 도입했다. DeepEP는 NVLink와 RDMA를 계층적으로 활용하고 GPU가 직접 NIC를 제어하는 방식을 통해 CPU 개입에 따른 지연을 제거했다. 32개 노드(256 GPU) 환경에서 이 기법은 통신 지연을 획기적으로 줄여 처리량을 베이스라인 대비 32% 향상시켰다.
연산 최적화(MXFP8)와 통신 최적화(DeepEP)는 서로 독립적인 병목 지점을 타격하므로 두 기법을 동시에 적용했을 때 시너지 효과가 발생한다. 671B 모델 실험에서 두 기법을 결합한 결과, 단일 기법 적용 시보다 높은 총 41%의 처리량(918 tokens/sec) 개선을 확인했다. 이는 연산과 통신이 모두 병목인 MoE 아키텍처에서 복합적 최적화의 중요성을 보여준다.


저정밀도 수치 형식인 MXFP8 도입에 따른 모델 성능 저하 여부를 검증하기 위해 DeepSeek-V3 16B 모델로 1,500 스텝의 학습 수렴 테스트를 수행했다. 실험 결과 MXFP8의 손실 곡선이 BF16 베이스라인과 거의 일치하여, 정밀도 하락 없이도 학습 가속이 가능함을 증명했다. 이는 대규모 모델의 실전 학습에서 MXFP8의 신뢰성을 뒷받침하는 근거가 된다.

용어 해설
- 마이크로스케일링 FP8(MXFP8)
- — 32개 요소 블록마다 공유 지수를 할당하는 8비트 부동소수점 형식으로, 수치 정밀도를 유지하며 연산 속도를 높인다. Blackwell GPU에서 네이티브로 지원되어 에뮬레이션 오버헤드 없이 최대 성능을 낸다.
- 전문가 혼합 모델(MoE)
- — 입력 토큰마다 전체 파라미터 중 일부 전문가 레이어만 활성화하여 실행하는 모델 구조다. 파라미터 규모를 키우면서도 추론 및 학습 시의 연산 비용을 효율적으로 관리할 수 있게 해준다.
- 전대전 통신(All-to-All)
- — 분산 컴퓨팅에서 모든 프로세스가 서로 데이터를 주고받는 통신 패턴이다. MoE 모델에서 토큰을 적절한 전문가에게 분배하고 결과를 다시 수집하는 과정에서 핵심적인 역할을 하며 흔히 병목이 된다.
- 그룹화된 행렬 곱셈(Grouped GEMM)
- — 서로 다른 크기의 여러 행렬 곱셈을 하나의 GPU 커널에서 묶어서 처리하는 기법이다. MoE의 전문가 레이어처럼 가변적인 크기의 데이터를 처리해야 하는 환경에서 연산 효율을 극대화하기 위해 사용된다.
- 원격 직접 메모리 접근(RDMA)
- — 네트워크를 통해 원격 컴퓨터의 메모리에 직접 접근하는 기술로, 데이터 전송 시 CPU의 개입을 최소화한다. 대규모 GPU 클러스터 간의 데이터 교환 지연 시간을 줄이는 데 필수적이다.
기술
- DeepSeek-V3
- PyTorch
- TorchTitan
- TorchAO
- DeepEP
- NVIDIA B200
- InfiniBand
활용 사례
- 초대형 MoE 모델 사전 학습
- Blackwell 기반 클러스터 성능 최적화
- 저정밀도 학습 안정성 검증
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 26.수집 2026. 03. 26.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.