본문으로 건너뛰기

MetaRoCE, AI용 Ethernet 전송 규격 공개

MetaRoCE가 패킷 손실과 다중 경로를 전제로 GPU 클러스터 통신을 제어한다

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

대규모 AI 학습과 추론에서는 GPU 사이의 all-reduce와 all-to-all 통신이 전체 작업 속도와 응답 지연을 좌우하므로, Meta는 commodity Ethernet용 RDMA transport protocol인 MetaRoCE를 설계했습니다. MetaRoCE는 NIC에 지능을 두고 패킷을 여러 경로에 분산하며, out-of-order 도착을 허용해 최종 memory 위치에 직접 기록하고 경로별 RTT·ECN·window를 독립적으로 관리합니다. ECN 기반 AIMD와 수신자 fair-share rate hint를 결합해 혼잡한 경로만 조절하고, 1% packet loss에서 약 86% throughput을 유지하며 10% loss에서도 동작을 이어갔습니다. Meta는 AMD Pensando NIC와 64-node AMD GPU cluster에서 RoCEv2와 비교한 결과를 바탕으로 specification, reference implementation, compliance suite를 Open Compute Project에 공개하고, 향후 rack 내부 scale-up과 장거리·storage·KV-cache 환경으로 확장할 계획입니다.

섹션별 상세

01
수십만 개의 GPU가 여러 데이터센터와 지역에 걸쳐 학습과 추론을 수행하면서 GPU 사이의 네트워크가 전체 작업 속도를 결정하는 병목이 됐습니다. All-reduce와 all-to-all에서는 가장 느린 데이터 전송이 수천 개 가속기의 진행 속도를 정하고, 추론에서는 분산된 model shard 사이의 지연이 사용자 응답 시간에 직접 반영됩니다. Meta는 commodity Ethernet에서 million-GPU 규모를 지원하기 위해 AI workload 전용 RDMA transport protocol인 MetaRoCE를 처음부터 설계했습니다.
여러 스위치와 계층을 연결한 네트워크 topology 및 GPU 배치 구조를 나타낸 기술 도식입니다.
Diagram도식은 여러 스위치 계층과 링크를 통해 GPU가 연결되는 구조를 나타내며, 하단에는 216 GPUs/L1과 20736 GPUs/L2라는 규모 수치가 표시됩니다. 여러 경로와 네트워크 계층을 활용하는 AI cluster의 확장 구조를 시각화하지만, 본문의 MetaRoCE packet transport 결과를 직접 측정한 그래프는 아닙니다. 따라서 대규모 multiplane fabric과 scale-out networking이라는 배경을 보완하는 자료로 연결됩니다.
02
기존 RoCE는 모든 frame이 순서대로 도착하고 네트워크가 PFC를 통해 무손실 상태를 유지한다는 전제에 의존합니다. MetaRoCE는 네트워크 fabric에 모든 지능을 맡기는 대신 endpoint의 NIC가 per-path RTT, ECN 상태, utilization을 수집하고 여러 개의 세밀한 논리 경로를 관리합니다. 그 결과 높은 처리량과 낮은 tail latency를 유지하면서도 대규모 환경에서 운영 복잡성을 줄이는 방향을 취합니다.
기존의 불투명한 단일 network pipe와 MetaRoCE의 fine-grained logical path 구조를 비교한 개념도입니다.
Diagram왼쪽은 애플리케이션과 endpoint transport가 하나의 크고 불투명한 network pipe로 연결되고, coarse ECN 또는 CNP만 사용하는 현재 구조를 나타냅니다. 오른쪽은 NIC가 여러 개의 작은 경로를 관리하면서 per-path RTT와 ECN 신호를 바탕으로 transport를 제어하는 MetaRoCE 구조를 나타냅니다. 본문의 endpoint 지능 이동, packet spraying, 경로별 telemetry라는 핵심 설계와 직접 연결됩니다.
03
MetaRoCE는 패킷을 여러 경로에 packet 단위로 분산하며 out-of-order 도착을 정상적인 상태로 처리합니다. 각 packet이 최종 목적지 정보를 가지므로 수신 데이터가 도착 즉시 해당 memory 위치에 기록되고, reorder buffer와 head-of-line blocking이 필요하지 않습니다. Write는 packet마다 목적지를 담고 Send는 posted receive buffer와의 match를 담아 앞선 메시지를 기다리거나 별도 왕복으로 목적지를 확인하지 않아도 됩니다.
04
각 연결은 여러 first-class path를 갖고, 경로마다 독립적인 window와 round-trip estimate를 유지합니다. 서로 다른 UDP source port를 ECMP entropy로 사용해 NIC가 언제든 문제가 있는 route에서 트래픽을 옮길 수 있으며, 혼잡이나 장애가 발생한 경로 하나만 느려지고 연결 전체가 멈추지 않습니다. 256-bit selective acknowledgment bitvector의 gap이 손실을 나타내면 MetaRoCE는 누락된 packet만 해당 경로에서 즉시 재전송합니다.
05
혼잡 제어는 송신자의 ECN 기반 AIMD와 수신자의 fair-share rate hint를 결합합니다. 수신자는 모든 acknowledgment에 자신이 송신자에게 할당한 inbound bandwidth 비율을 실어 보내고, 송신자는 이를 이용해 목표 속도에 직접 접근하며 congestion mark가 발생한 경로의 window만 줄입니다. 기사에서는 이 구조가 Incast를 한두 번의 왕복 시간 안에 해결하고 공정성과 tail latency를 개선한다고 설명합니다.
ECMP fabric을 통과하는 여러 경로의 혼잡 신호와 QP window 업데이트를 나타낸 다이어그램입니다.
Diagram그림은 ACK, Congestion Experienced, N Packets Drop 신호가 QP의 congestion window 업데이트에 연결되는 과정을 보여줍니다. MetaRoCE의 ECMP fabric은 여러 경로를 제공하고, 각 경로의 신호에 따라 additive increase 또는 multiplicative decrease가 적용됩니다. 하단의 feedback loop는 수신 ACK가 QP의 rate 제어에 사용된다는 본문의 혼잡 제어 설명을 뒷받침합니다.
06
MetaRoCE는 fabric에 ECN과 ECMP만 요구하며 PFC, pause frame, packet trimming, in-network telemetry, credit-based flow control 또는 switch-side spraying을 필수로 만들지 않습니다. 따라서 fat-tree, multiplane, deep-buffer, shallow-buffer fabric과 공급자 설정을 통제할 수 없는 vendor cloud에서도 같은 transport를 사용할 수 있습니다. QP 하나가 여러 독립 ordered stream과 여러 network path를 함께 운반하므로 workload의 parallelism이 커져도 연결 상태가 그에 비례해 증가하지 않으며, 기존 RDMA Verbs API와 software stack도 수정 없이 유지됩니다.
서로 다른 PATH ID를 가진 세 개의 경로에 application message가 분산되고 수신자 memory로 전달되는 과정을 나타낸 다이어그램입니다.
DiagramApplication Messages의 M0, M1, M2가 QP를 거쳐 PATH ID 1, 2, 3으로 나뉘고 각 경로의 RTT가 별도로 표시됩니다. 수신 측 QP는 도착한 데이터를 Receiver Memory의 해당 영역으로 전달하며, 경로마다 독립적인 순서와 상태를 유지하는 구조를 시각화합니다. 이는 MetaRoCE가 여러 ordered stream과 path를 하나의 연결 아래에서 관리한다는 설명과 이어집니다.
07
Meta는 AMD와 협력해 AMD Pensando programmable NIC에 MetaRoCE를 구현하고, RCCL collective를 실행하는 64-node AMD GPU cluster에서 RoCEv2와 비교했습니다. MetaRoCE는 all-reduce와 all-to-all에서 더 높은 throughput과 더 짧은 flow completion time을 기록했으며, 1% packet loss에서도 약 86% throughput을 유지하고 10%의 극단적 손실에서도 유용한 bandwidth를 계속 제공했습니다. 4-plane과 8-plane topology에서 최대 4,000개의 동시 연결을 검증한 결과 throughput이 plane 수에 따라 선형으로 증가했고, plane 장애 때는 애플리케이션이나 운영자 개입 없이 트래픽이 재분배됐습니다.
64 GPU 환경에서 All Reduce와 All To All의 completion time 변화를 baseline 대비 백분율로 비교한 막대그래프입니다.
Chart상단 All Reduce 그래프에서는 대부분의 message size 구간에서 막대가 0% 아래에 있어 baseline보다 completion time이 감소한 결과를 나타냅니다. 하단 All To All 그래프도 여러 구간에서 음의 변화를 보이지만 일부 message size에서는 양의 변화가 나타나 성능 이득이 모든 조건에서 동일하지 않음을 보여줍니다. 본문의 64-node AMD GPU cluster에서 RoCEv2와 비교해 더 높은 throughput과 짧은 flow completion time을 기록했다는 결과와 연결됩니다.
08
Meta는 MetaRoCE specification, reference software implementation, compliance test suite를 Open Compute Project를 통해 공개해 여러 업체가 호환 hardware를 구현하도록 할 계획입니다. libsoftmetaroce는 specialized hardware 없이 commodity Linux의 standard UDP socket에서 실행되는 완전한 transport stack이며, silicon 개발을 위한 authoritative behavioral model과 통합 compliance framework의 기반으로 사용됩니다. 2026년 10월 OCP Global Summit에서는 specification과 DPDK-optimized reference implementation, production compliance framework를 공개할 예정입니다.
09
향후 개발은 rack 내부의 nanosecond 단위 scale-up, 수천 킬로미터에 걸친 scale-across, 분산 storage와 KV-cache workload로 확장됩니다. Scale-up에서는 reorder buffer와 PFC를 제거한 뒤 짧은 memory operation을 위한 fast signaling path를 최적화하고, scale-across에서는 서로 다른 장거리 경로의 공정한 bandwidth 공유를 해결해야 합니다. Storage와 KV-cache에서는 하나의 read가 수십 또는 수천 서버로 fan-out되는 Incast를 수신자 주도 rate hint로 제어하되, 네트워크 속도와 요청 크기가 달라져도 rate를 정확하게 유지하는 과제가 남아 있습니다.

용어 해설

RDMA
RDMA는 운영체제의 개입을 줄이고 네트워크 카드가 원격 메모리에 직접 데이터를 전송하는 통신 방식입니다. GPU 간 대규모 데이터 교환에서 CPU 복사와 지연을 줄이는 데 중요하지만, 기존 RoCE는 패킷 순서와 무손실 네트워크에 크게 의존합니다.
ECMP
ECMP는 여러 개의 동일 비용 경로에 트래픽을 분산하는 네트워크 방식입니다. MetaRoCE에서는 각 경로가 서로 다른 UDP source port를 사용하고 NIC가 이를 바꿔 특정 경로의 혼잡이나 장애를 피하도록 만듭니다.
ECN
ECN은 네트워크 장비가 패킷을 버리지 않고 혼잡 상태를 표시해 송신자에게 알리는 방식입니다. MetaRoCE는 경로별 ECN 상태를 바탕으로 혼잡이 발생한 경로의 전송률만 낮추고 다른 경로로 패킷을 보냅니다.
AIMD 혼잡 제어(AIMD)
AIMD는 혼잡이 없을 때 전송 창을 점진적으로 늘리고 혼잡 신호가 발생하면 전송률을 곱셈 방식으로 줄이는 제어 방식입니다. MetaRoCE는 송신자 주도 ECN 기반 AIMD와 수신자가 알려주는 공정한 대역폭 비율을 함께 사용합니다.
Incast
Incast는 여러 송신자가 하나의 수신자에게 동시에 데이터를 보내면서 수신 측 링크나 버퍼에 순간적인 혼잡이 집중되는 현상입니다. MetaRoCE는 수신자 주도 rate hint를 통해 각 송신자가 목표 속도에 직접 접근하게 하며, 기사에서는 한두 번의 왕복 시간 안에 Incast를 해소한다고 설명합니다.

기술

  • MetaRoCE
  • RoCE
  • RoCEv2
  • RDMA
  • Ethernet
  • PFC
  • ECN
  • ECMP
  • UDP
  • AMD Pensando
  • RCCL
  • Open Compute Project
  • libsoftmetaroce
  • DPDK
  • RDMA Verbs APIs

활용 사례

  • 대규모 AI model training
  • 분산 AI inference
  • all-reduce collective
  • all-to-all collective
  • multiplane GPU cluster
  • 분산 storage
  • KV-cache workload
  • 장거리 scale-across network
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 25.수집 2026. 08. 25.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.