TL;DR
NVIDIA GB300 NVL72는 72개 Blackwell GPU와 36개 Grace CPU를 한 랙의 NVLink Domain으로 연결해 GPU당 1,800 GB/s all-to-all bandwidth를 제공한다. Ray의 기존 Placement Group은 개별 노드 단위 배치만 이해했지만, 새 NVLink Domain-Aware Placement Groups는 여러 노드의 bundle을 하나의 랙 안에 STRICT_PACK으로 모아 NVLink를 통한 collective communication을 유도한다. NVIDIA GEAR와 수행한 512개 GPU 규모 VLA 학습에서 Domain-aware 배치를 적용한 실행은 초당 반복 횟수가 1.13배 높았고, 장애 때 같은 Domain의 여유 노드를 대체 자원으로 사용할 수 있었다. 현재는 STRICT_PACK만 지원하며, 향후 STRICT_SPREAD와 랙·데이터센터·가용 영역을 연결하는 nested topology로 확장될 예정이다.
빠른 이해
새로운 점
Ray Placement Group에 NVLink Domain 단위의 STRICT_PACK 제약을 추가해 랙 단위 GPU locality와 장애 복구 의도를 함께 보존한다.
핵심 메커니즘
사용자가 GPU와 CPU 요구량을 가진 여러 bundle을 정의하고 node-id에는 PACK, gpu-domain에는 STRICT_PACK을 지정하면 Ray가 bundle을 여러 노드에 나누되 하나의 NVLink Domain 안에 모은다. 이 배치로 actor 간 all_reduce와 메모리 교환이 도메인 밖의 InfiniBand나 RoCE 경로보다 빠른 NVLink 경로를 우선 사용하고, 노드 장애가 발생하면 같은 Domain의 여유 노드로 bundle을 대체한다. GB300 VLA 학습에서는 512개 GPU와 128개 노드를 8개 그룹으로 나누어 비교했으며, Domain-aware 배치를 적용한 실행의 초당 반복 횟수가 1.13배 높았다.
핵심 수치
- GB300 NVL72 GPU 수: 72개 NVIDIA Blackwell GPU- 랙 단위 NVLink scale-up 시스템
- GB300 NVL72 CPU 수: 36개 NVIDIA Grace CPU- GB300 NVL72 구성
- GPU당 all-to-all 대역폭: 1,800 GB/s- GB200 및 GB300 NVL72
- 비교 학습 규모: 512개 GPU, 128개 노드- 64개 GPU와 16개 노드로 구성된 그룹 8개
- 학습 반복 처리량: 1.13배- NVLink Domain-aware 배치를 적용한 두 번째 실행이 첫 번째 실행보다 빠름
섹션별 상세
GB300 NVL72의 랙 단위 GPU 연결


Ray 스케줄링에 토폴로지 제약 추가
NVLink Domain-Aware Placement Groups의 작동 방식
bundles = [{"GPU": 4, "CPU": 2}] * 16
topology_strategy = {"ray.io/node-id": "PACK", "ray.io/gpu-domain": "STRICT_PACK"}
pg = placement_group(
bundles=bundles,
topology_strategy=topology_strategy,
name="gb300_single_rack_16_node_pg",
)
ray.get(pg.ready())16개 bundle을 생성한 뒤 node-id 기준으로 묶고 gpu-domain 기준으로 한 NVLink Domain에 엄격하게 배치하도록 Ray Placement Group을 생성한다.

통신 경로와 장애 복구를 함께 보존

GB300 VLA 학습에서 확인한 처리량 차이


분산 추론과 강화학습으로 확장
향후 토폴로지 스케줄링 방향
용어 해설
- NVLink Domain
- — 여러 노드의 GPU를 NVIDIA NVLink scale-up fabric으로 연결한 논리적 통신 영역이다. GB300 NVL72에서는 하나의 랙이 NVLink Domain에 해당하며, 같은 영역에 배치된 GPU는 랙 밖의 InfiniBand나 RoCE 경로보다 빠른 GPU 간 통신과 메모리 전송을 활용할 수 있다.
- Placement Group
- — Ray에서 여러 작업 단위인 bundle을 함께 배치하도록 예약하는 스케줄링 단위다. 각 bundle이 요구하는 GPU와 CPU 자원을 정의하고, PACK이나 STRICT_PACK 같은 전략으로 노드 단위 배치 제약을 지정한다.
- All-to-All 대역폭(All-to-All Bandwidth)
- — 한 GPU가 다른 GPU들과 동시에 데이터를 주고받을 수 있는 통신 용량이다. 글에서는 GB200 및 GB300 NVL72가 GPU당 1,800 GB/s의 all-to-all bandwidth를 제공해 72개 GPU가 하나의 계산 자원처럼 협력한다고 설명한다.
- 집단 통신(Collective Communication)
- — 분산 학습에 참여한 여러 GPU가 동시에 데이터를 교환하는 통신 방식이다. all_reduce처럼 각 GPU의 값을 모아 다시 모든 GPU에 전달하는 연산이 대표적이며, GPU 사이의 연결 경로가 빠를수록 통신 대기 시간이 줄어든다.
- NVIDIA SHARP
- — 분산 학습의 collective communication을 가속하는 NVIDIA 기술이다. NVLink Domain 안에 밀접하게 통신하는 actor를 배치하면 all_reduce 같은 연산에서 NVLink를 활용하고 NVIDIA SHARP와 같은 가속 기능도 더 효과적으로 사용할 수 있다.
- Placement Group Bundle
- — Placement Group 안에서 특정 노드에 배치될 자원 요구량을 나타내는 단위다. 예시에서는 각 bundle이 GPU 4개와 CPU 2개를 요구하며, 16개 bundle을 하나의 NVLink Domain에 배치해 총 64개 GPU 규모의 actor 집합을 구성한다.
기술
- NVIDIA GB300 NVL72
- NVIDIA GB200 NVL72
- NVIDIA Blackwell GPU
- NVIDIA Grace CPU
- NVIDIA NVLink
- Ray
- Placement Groups
- NVIDIA SHARP
- InfiniBand
- RoCE
- VLA
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.