본문으로 건너뛰기

BlueField-4로 확장하는 AI Factory 인프라

BlueField-4와 DOCA와 Spectrum-X Ethernet을 결합해 AI Factory의 데이터 접근과 보안과 운영을 호스트 CPU 밖에서 가속하는 Scale-In 인프라다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Agentic AI Factory는 GPU뿐 아니라 사용자, 에이전트, 애플리케이션, 기업 데이터, 스토리지가 지속적으로 연결되므로 기존 호스트 CPU 중심 인프라만으로는 접근, 보안, 스토리지, 운영 처리가 병목이 될 수 있다. NVIDIA의 Scale-In은 BlueField-4 DPU를 인프라 처리 영역으로 분리하고 DOCA로 서비스와 정책을 프로그래밍하며 Spectrum-X Ethernet으로 외부 데이터와 스토리지 트래픽을 연결한다. BlueField-4는 최대 800 Gb/s의 인라인 가속, BlueField-3 대비 4배의 메모리 대역폭과 2배의 네트워크 대역폭을 제공하고, Astra는 North-South와 East-West 네트워크의 정책을 동기화한다. 이 구조는 Vera Rubin에서 7.2 Tb/s의 집계 인터페이스를 대상으로 테넌트 격리와 보안 정책을 적용하며, 스토리지 경로에서는 오프더셸프 Ethernet 대비 최대 1.45배의 처리량을 제시한다. 다만 기사에 제시된 수치는 NVIDIA가 설명한 제품 구성과 비교 조건에 기반하므로 실제 환경에서는 워크로드와 네트워크 구성에 따른 검증이 필요하다.

빠른 이해

새로운 점

GPU 간 연결과 랙 간 네트워크 확장을 넘어, BlueField-4 DPU가 AI Factory 주변의 접근, 보안, 스토리지, 프로비저닝, 관측을 하나의 가속 인프라 영역으로 묶는 Scale-In 개념이다.

핵심 메커니즘

외부 사용자와 애플리케이션과 데이터와 스토리지의 트래픽이 Spectrum-X Ethernet을 통해 AI Factory로 들어오면 BlueField-4가 호스트 CPU와 독립된 처리 영역에서 패킷, RDMA, 스토리지 프로토콜, 암호화, 방화벽 정책을 인라인으로 처리한다. DOCA Flow와 DOCA 마이크로서비스가 정책과 서비스 순서를 프로그래밍하고, BlueField Astra가 North-South 접근망과 East-West Scale-Out 패브릭의 정책과 키와 텔레메트리를 동기화한다. 컨트롤 플레인의 소프트웨어가 정책을 결정하고 데이터 경로의 가속 엔진과 ConnectX-9가 이를 로컬에서 집행하므로, 테넌트 호스트에 작업을 되돌리지 않은 채 최대 800 Gb/s 처리와 일관된 격리를 수행한다. DOCA Telemetry는 그 결과를 플릿 단위 관측 시스템으로 내보내며, 스토리지 경로에서는 최대 1.45배의 처리량 향상을 목표로 외부 데이터가 GPU에 공급되도록 한다.

핵심 수치

  • BlueField-4 인라인 처리 속도: 최대 800 Gb/s- 패킷, RDMA, 스토리지 프로토콜, 암호화, 방화벽 규칙, 정책 집행
  • BlueField-4 메모리 대역폭: BlueField-3 대비 4배- 기사의 세대 비교 수치
  • BlueField-4 네트워크 대역폭: BlueField-3 대비 2배- 기사의 세대 비교 수치
  • Vera Rubin 집계 인터페이스 대역폭: 7.2 Tb/s- 800 Gb/s North-South 1개와 1.6 Tb/s East-West 4개
  • Scale-In 스토리지 처리량: 오프더셸프 Ethernet 대비 최대 1.45배- Spectrum-X Ethernet 기반 스토리지 경로
  • Grace CPU 처리 능력: 이전 세대 대비 6배- 여러 인프라 서비스를 동시에 실행하는 용도

섹션별 상세

01

AI Factory를 위한 다섯 번째 인프라 축

기존 클라우드 인프라는 예측 가능한 범용 작업과 표준 인터페이스를 전제로 설계됐지만, Agentic AI Factory는 사용자, 에이전트, 애플리케이션, 기업 데이터, 스토리지를 대규모 가속 컴퓨팅과 지속적으로 연결한다. NVIDIA는 이 환경에서 GPU 연산만 확장하면 데이터 접근, 보안, 운영이 병목이 될 수 있다고 보고 Scale-In을 AI 네트워킹의 다섯 번째 축으로 배치한다. Scale-Up은 한 시스템 안에서 GPU를 결합하고, Scale-Out은 랙과 서버를 연결하며, Scale-Across는 여러 시설을 잇고, CMX는 공유 KV Cache를 저장하는 반면 Scale-In은 연산 주변의 접근, 보안, 데이터 이동, 프로비저닝, 관측을 맡는다. 이 구분은 GPU와 네트워크의 규모뿐 아니라 연산에 데이터를 공급하고 공유 인프라를 안전하게 운영하는 기능까지 함께 확장해야 AI Factory의 성능이 유지된다는 의미다.
Scale-Up, Scale-Out, Scale-Across, Scale-In의 연결 범위와 각 영역의 구성 요소를 비교한 아키텍처 다이어그램이다.
Diagram다이어그램은 Scale-Up에서 GPU와 CX 및 BF 어댑터가 묶이고, Scale-Out에서 여러 GPU 노드가 연결되며, Scale-Across에서 분산된 AI Factory가 이어지는 구조를 나타낸다. Scale-In은 Agentic CPU, Agentic Storage, Cloud Services, Cloud Security, WAN Access, Data Center Orchestration을 공통 네트워크 평면으로 연결해 컴퓨트 주변 인프라의 접근과 운영을 통합한다. 본문이 설명하는 다섯 인프라 축 가운데 Scale-In이 단순 GPU 연결이 아니라 보안, 스토리지, 클라우드 서비스, 오케스트레이션까지 포괄한다는 점을 시각적으로 뒷받침한다.
02

호스트 CPU와 분리된 BlueField-4 처리

BlueField-4는 GPU 서버, Agentic CPU 시스템, AI Factory 스토리지, 클라우드 서비스에서 인프라 서비스를 호스트 CPU와 독립적으로 실행하는 DPU다. 64코어 NVIDIA Grace CPU가 정책, 프로비저닝, 텔레메트리, 오케스트레이션 소프트웨어를 처리하고, 인라인 가속 엔진이 패킷, RDMA, 스토리지 프로토콜, 암호화, 방화벽 규칙을 데이터 경로에서 실행한다. 인라인 엔진은 최대 800 Gb/s로 작업을 처리하며, BlueField-3보다 메모리 대역폭은 4배, 네트워크 대역폭은 2배 증가했다. 그 결과 테넌트 호스트의 CPU 자원을 빼앗지 않으면서 정책과 서비스 상태를 별도 처리 영역에 유지하고, 더 많은 동시 서비스와 정책·텔레메트리 데이터를 수용하는 구조가 된다.
03

정책 결정과 데이터 경로 집행의 폐루프

AI Factory에서는 보안 정책을 중앙에서 관리하면서도 각 트래픽 흐름에 빠르게 적용해야 하므로, 모든 처리를 테넌트 호스트의 소프트웨어에 맡기면 격리와 성능이 흔들릴 수 있다. BlueField-4의 프로그래머블 컨트롤 플레인은 정책을 결정하고, 인라인 데이터 경로 엔진은 호스트 CPU로 작업을 되돌리지 않은 채 로컬에서 정책을 집행한다. BlueField Astra는 North-South 접근망과 East-West Scale-Out 패브릭의 프로비저닝, 테넌트 격리, 네트워크 정책을 하나의 제어 지점에서 조정하며, BlueField-4가 정책과 텔레메트리를 갱신하고 ConnectX-9가 데이터 경로에서 이를 적용한다. 이 구조는 장치 관리와 보안 제어를 테넌트 운영체제 밖에 두면서 공통 정책을 여러 네트워크 영역에 일관되게 적용하는 근거가 된다.
04

DOCA 기반의 프로그래머블 인프라 서비스

BlueField-4의 하드웨어 가속기를 실제 운영 서비스로 연결하려면 장치별 기능을 일관된 방식으로 배포하고 업데이트할 소프트웨어 계층이 필요하다. DOCA는 BlueField-4에서 직접 실행되는 컨테이너형 마이크로서비스와 사용자 정의 서비스를 위한 라이브러리 및 SDK를 제공하며, DOCA Flow는 패킷 처리 파이프라인, DOCA PCC는 프로그래머블 혼잡 제어, DOCA Telemetry는 장치와 서비스 상태, DOCA Platform Framework는 프로비저닝과 배포와 업데이트를 맡는다. 멀티서비스 구조와 네이티브 서비스 함수 체이닝은 트래픽마다 필요한 서비스 순서를 지정해 별도의 서버 파이프라인을 관리하는 부담을 줄인다. 따라서 운영자는 네트워크, 보안, 스토리지, 관측 서비스를 같은 프로그래밍 모델로 구성하고 BlueField 시스템 전반에 배포할 수 있다.
05

Spectrum-X Ethernet과 스토리지 경로

AI 모델 학습과 추론은 외부 스토리지의 데이터가 제때 도착해야 GPU가 유휴 상태에 빠지지 않으므로 스토리지 프로토콜과 네트워크 혼잡도 연산 성능의 일부가 된다. BlueField-4는 NVMe-oF, RDMA와 TCP 기반 파일·오브젝트 스토리지 프로토콜, 스토리지 가상화, 데이터 이동을 전용 인프라 처리 영역에서 가속하고, Spectrum-X Ethernet은 AI Factory와 외부 스토리지 사이의 트래픽을 전달한다. 혼잡 관리와 성능 격리는 여러 스토리지 흐름이 동시에 발생할 때 유효 대역폭을 유지하며, 기사에 따르면 오프더셸프 Ethernet보다 스토리지 처리량이 최대 1.45배 높다. 이 외부 데이터 경로는 Factory 내부에서 공유 KV Cache와 추론 상태를 보존하는 CMX와 보완 관계를 이루어, Scale-In은 외부 데이터 접근을 맡고 CMX는 재사용 가능한 문맥 저장을 맡는다.
06

공유 인프라의 격리와 운영 자동화

여러 테넌트가 같은 물리 인프라를 사용할 때는 가상 사설 클라우드의 트래픽 격리, 보안 정책, 노드 배포, 운영 상태 확인을 함께 처리해야 한다. DOCA Host-Based Networking은 BlueField-4에서 North-South Layer 3 라우팅과 멀티테넌트 격리를 가속하고, DOCA Flow와 OVS-DOCA가 트래픽 분류와 접근 제어를 수행하며, Astra가 같은 정책을 East-West 경로까지 확장한다. Vera Rubin에서는 이 정책 모델이 800 Gb/s North-South 경로와 컴퓨트 트레이당 1.6 Tb/s East-West 경로 4개를 합친 총 7.2 Tb/s 인터페이스 대역폭에 적용된다. 또한 DOCA Argus는 런타임 위협 탐지, DOCA Vault는 파일 접근 정책, DOCA Platform Framework는 Kubernetes 노드로서 DPU 검색과 서비스 배포와 업데이트를 맡아 새 노드의 온보딩과 구성을 자동화한다.
07

관측 데이터로 병목을 찾는 운영 모델

대규모 AI Factory에서는 네트워크 트래픽, 스토리지 접근, 서비스 상태, 성능, 자원 사용률을 테넌트 호스트의 소프트웨어와 독립적으로 수집해야 장애와 병목의 위치를 구분할 수 있다. DOCA Telemetry는 BlueField-4에서 인프라 신호를 모아 외부 네트워크 모니터링 플랫폼으로 내보내고, DOCA 라이브러리는 관측 도구가 같은 신호를 자체 시스템에 통합하도록 지원한다. 운영자는 GPU와 네트워크 사용률을 접근 경로, 트래픽, 스토리지, 정책 집행, 워크로드 배치 정보와 함께 비교해 이상 징후와 자원 제약을 찾는다. 이렇게 수집 범위를 서버 한 대가 아니라 전체 플릿으로 넓히면 AI 작업에 영향을 주기 전에 구성 오류와 처리 병목을 식별하는 운영 기반을 확보할 수 있다.

용어 해설

Scale-In
AI Factory에서 GPU 연산 주변의 데이터 접근, 보안, 스토리지, 프로비저닝, 관측 기능을 하나의 가속 인프라 영역으로 묶는 NVIDIA의 네트워킹 개념이다. BlueField-4 DPU가 호스트 CPU와 분리된 처리를 맡고 DOCA와 Spectrum-X Ethernet이 서비스 실행과 고속 연결을 지원한다.
DPU
데이터 처리 장치로, 서버 CPU 대신 네트워크, 스토리지, 보안 같은 인프라 작업을 전담하는 프로세서다. BlueField-4는 패킷 처리와 RDMA, 스토리지 프로토콜, 암호화, 방화벽 정책을 데이터 경로에서 실행해 호스트 CPU의 부담을 줄인다.
North-South 네트워크(North-South Network)
데이터센터 외부의 사용자, 애플리케이션, 데이터 소스, 스토리지와 내부 서버를 연결하는 입출입 경로다. Scale-In은 이 경로를 단순 연결망이 아니라 접근 제어, 데이터 이동, 보안, 프로비저닝, 관측을 함께 처리하는 가속 인프라 영역으로 확장한다.
East-West 네트워크(East-West Network)
데이터센터 내부의 서버와 GPU 노드 사이에서 트래픽을 전달하는 네트워크다. BlueField Astra는 North-South 경로와 Scale-Out의 East-West 경로에 동일한 테넌트 격리와 보안 정책을 적용하도록 조정한다.
서비스 함수 체이닝(Service Function Chaining)
하나의 트래픽 흐름을 라우팅, 방화벽, 암호화, 스토리지 처리처럼 필요한 서비스 순서에 따라 통과시키는 방식이다. BlueField-4의 멀티서비스 구조는 각 흐름을 요구된 서비스 조합으로 보내고 데이터 경로의 가속 엔진이 이를 로컬에서 처리한다.
KV Cache
LLM이 대화나 문맥을 생성할 때 이미 계산한 Key와 Value 상태를 저장해 다음 토큰 계산에 재사용하는 데이터다. 기사에서 CMX는 AI Factory 내부의 공유 KV Cache와 재사용 가능한 추론 상태를 저장하며, Scale-In의 외부 데이터 접근 경로와 별도 역할을 맡는다.

기술

  • BlueField-4
  • NVIDIA DOCA
  • Spectrum-X Ethernet
  • BlueField Astra
  • ConnectX-9 SuperNICs
  • NVIDIA Vera Rubin NVL72
  • NVIDIA NVLink
  • NVIDIA Quantum InfiniBand
  • NVIDIA Spectrum-XGS Ethernet
  • NVIDIA CMX
  • NVIDIA STX
  • DOCA Flow
  • DOCA PCC
  • DOCA Telemetry
  • DOCA Platform Framework
  • DOCA Host-Based Networking
  • OVS-DOCA
  • DOCA Argus
  • DOCA Vault
  • NVMe-oF
  • RDMA
  • Kubernetes

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 08. 25.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.