TL;DR
대규모 AI 학습과 추론에서는 GPU 사이의 all-reduce와 all-to-all 통신이 전체 작업 속도와 응답 지연을 좌우하므로, Meta는 commodity Ethernet용 RDMA transport protocol인 MetaRoCE를 설계했습니다. MetaRoCE는 NIC에 지능을 두고 패킷을 여러 경로에 분산하며, out-of-order 도착을 허용해 최종 memory 위치에 직접 기록하고 경로별 RTT·ECN·window를 독립적으로 관리합니다. ECN 기반 AIMD와 수신자 fair-share rate hint를 결합해 혼잡한 경로만 조절하고, 1% packet loss에서 약 86% throughput을 유지하며 10% loss에서도 동작을 이어갔습니다. Meta는 AMD Pensando NIC와 64-node AMD GPU cluster에서 RoCEv2와 비교한 결과를 바탕으로 specification, reference implementation, compliance suite를 Open Compute Project에 공개하고, 향후 rack 내부 scale-up과 장거리·storage·KV-cache 환경으로 확장할 계획입니다.
섹션별 상세





용어 해설
- RDMA
- — RDMA는 운영체제의 개입을 줄이고 네트워크 카드가 원격 메모리에 직접 데이터를 전송하는 통신 방식입니다. GPU 간 대규모 데이터 교환에서 CPU 복사와 지연을 줄이는 데 중요하지만, 기존 RoCE는 패킷 순서와 무손실 네트워크에 크게 의존합니다.
- ECMP
- — ECMP는 여러 개의 동일 비용 경로에 트래픽을 분산하는 네트워크 방식입니다. MetaRoCE에서는 각 경로가 서로 다른 UDP source port를 사용하고 NIC가 이를 바꿔 특정 경로의 혼잡이나 장애를 피하도록 만듭니다.
- ECN
- — ECN은 네트워크 장비가 패킷을 버리지 않고 혼잡 상태를 표시해 송신자에게 알리는 방식입니다. MetaRoCE는 경로별 ECN 상태를 바탕으로 혼잡이 발생한 경로의 전송률만 낮추고 다른 경로로 패킷을 보냅니다.
- AIMD 혼잡 제어(AIMD)
- — AIMD는 혼잡이 없을 때 전송 창을 점진적으로 늘리고 혼잡 신호가 발생하면 전송률을 곱셈 방식으로 줄이는 제어 방식입니다. MetaRoCE는 송신자 주도 ECN 기반 AIMD와 수신자가 알려주는 공정한 대역폭 비율을 함께 사용합니다.
- Incast
- — Incast는 여러 송신자가 하나의 수신자에게 동시에 데이터를 보내면서 수신 측 링크나 버퍼에 순간적인 혼잡이 집중되는 현상입니다. MetaRoCE는 수신자 주도 rate hint를 통해 각 송신자가 목표 속도에 직접 접근하게 하며, 기사에서는 한두 번의 왕복 시간 안에 Incast를 해소한다고 설명합니다.
기술
- MetaRoCE
- RoCE
- RoCEv2
- RDMA
- Ethernet
- PFC
- ECN
- ECMP
- UDP
- AMD Pensando
- RCCL
- Open Compute Project
- libsoftmetaroce
- DPDK
- RDMA Verbs APIs
활용 사례
- 대규모 AI model training
- 분산 AI inference
- all-reduce collective
- all-to-all collective
- multiplane GPU cluster
- 분산 storage
- KV-cache workload
- 장거리 scale-across network
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

