TL;DR
Meta는 광고 추천용 파운데이션 모델 GEM을 LLM 규모로 학습하면서 커널·정밀도·병렬화·네트워크·메모리를 공동 설계해 지난 12개월간 학습 FLOPs를 4배로 확장하고 E2E 학습 효율을 두 배로 높여 MFU를 20–25%로 끌어올렸다. 핵심 기여는 비정형 시퀀스에 맞춘 Jagged Flash Attention 등 맞춤형 어텐션 커널과 MXFP8 같은 초저정밀도 혼합 학습으로 단일 GPU 효율을 개선한 점이며, 토폴로지 인지 5D 병렬화와 샤딩 조합으로 통신 비용을 낮춘 점이다. 이 접근으로 추천 도메인의 희소 임베딩과 밀집 파라미터를 함께 다루면서 LLM 최적화법을 그대로 적용할 수 없던 한계를 극복했다.
섹션별 상세

- GEM의 E2E 학습 효율을 두 배로 올려 Model FLOPs Utilization을 20–25%로 향상시켰다. — 본문 서두에서 지난 12개월간 E2E 학습 효율을 두 배로 높여 MFU를 20–25%로 달성했다고 명시.
- 학습 총 FLOPs를 지난 12개월 동안 4배로 확장했다. — 요약 문장에 'scaling training FLOPs 4x in 12 months'라는 수치가 표시되어 있음.
용어 해설
- 모델 FLOPs 활용률(MFU)(Model FLOPs Utilization (MFU))
- — 모델이 실제로 연산 능력을 얼마나 활용하는지를 나타내는 지표로, 높은 MFU는 GPU 자원을 효율적으로 사용해 학습 시간을 단축하고 비용을 낮춘다. 하드웨어별 병목 분석과 커널·병렬화 전략 최적화에서 핵심 성능 기준으로 활용된다.
- Jagged Flash Attention
- — 비정형 시퀀스 길이를 가진 추천 데이터에 맞춰 메모리 접근과 연산을 최적화한 어텐션 커널로, 패딩 비용을 줄이고 GPU 캐시·메모리 활용을 개선한다. 추천 워크로드의 희소성·가변 길이 특성에서 연산 효율을 끌어올릴 때 사용된다.
- 토폴로지 인지 5D 병렬화(Topology-aware 5D parallelism)
- — 네트워크 토폴로지와 계층적 통신 구조를 고려해 모델·데이터·전문가 파라미터를 다차원으로 분할하는 병렬화 방식으로, 통신 병목을 줄이고 확장성을 높이기 위해 설계된다. 대규모 GPU 클러스터에서 스케일업 시 통신 오버헤드를 완화하는 목적이다.
- 완전 샤딩 데이터 병렬화(FSDP)(Fully Sharded Data Parallelism (FSDP))
- — 모델 파라미터와 옵티마이저 상태를 GPU 간에 샤딩해 메모리 사용량을 줄이는 기법으로, 대형 모델을 작은 메모리 footprint로 분산 학습할 때 유용하다. 추천 모델의 거대한 임베딩과 밀집 파라미터를 동시에 다룰 때 메모리 확장성 확보에 사용된다.
- 희소 임베딩 파라미터(Sparse embedding parameters)
- — 수조 개 규모로 존재할 수 있는 카테고리·ID 기반 임베딩으로, 일반적인 밀집 파라미터와 다른 분산·샤딩·캐시 전략이 필요하다. 대규모 추천 시스템에서 조회·통신 비용을 낮추려면 샤딩 및 부분 로딩 설계가 필수적이다.
근거 모음
- 추천 워크로드에 맞춘 커널(Jagged Flash Attention, GDPA, BlockAttention 등)과 MXFP8 같은 초저정밀도 혼합 정밀도로 단일 GPU 효율을 높였다. — 본문에서 맞춤형 커널들과 MXFP8 포함 초저정밀도 학습을 통해 최신 GPU 아키텍처를 활용했다고 기술.
- 토폴로지 인지 5D 병렬화와 SM-free collectives, 2D FSDP+Expert Parallelism 조합으로 통신 오버헤드를 줄였다. — 스케일링 효율성 항목에 'Topology-aware 5D parallelism'과 각종 병렬화 조합을 네트워크 계층과 함께 설계했다고 기술.
기술
- Jagged Flash Attention
- Generalized Dot-Product Attention
- BlockAttention
- MXFP8
- Topology-aware 5D parallelism
- 2D FSDP
- Expert Parallelism
- Fully Sharded 2D Model Parallelism
- Latest-generation GPUs
활용 사례
- Instagram과 Facebook의 광고 추천을 위한 파운데이션 모델 학습
- 대규모 희소·밀집 하이브리드 모델을 LLM 스케일로 확장해 광고 CTR·CVR 예측 성능 향상
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.