본문으로 건너뛰기

NVIDIA, 에이전트형 AI용 추론 공장 확장

NVIDIA가 Vera Rubin과 Groq 3 LPX를 결합해 에이전트형 AI 추론 인프라를 확장합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

AI inference가 학습 이후의 핵심 경쟁 영역으로 이동하면서 NVIDIA는 Vera Rubin NVL72, Groq 3 LPX, Spectrum-X Ethernet을 하나의 AI factory로 공동 설계하는 전략을 내놓았습니다. Groq 3 LPX는 Rubin GPU가 처리한 긴 문맥을 바탕으로 토큰을 한 개씩 생성하는 decode workload를 가속하며, Gemma 4 31B benchmark에서 100,000토큰 문맥 기준 초당 3,400 output tokens와 대안 플랫폼 대비 4배 빠른 결과를 기록했습니다. Spectrum-X Multiplane은 서버 연결을 여러 독립 plane으로 분할해 최대 512,000 GPU까지 확장하고 장애 시 대역폭을 유지하며, BlueField-4 기반 Scale-In은 보안·스토리지·운영 기능을 호스트 연산과 분리합니다. NVLink Fusion은 custom XPU와 CPU를 NVIDIA의 네트워크·랙·소프트웨어 생태계에 연결해 에이전트형 AI를 위한 반맞춤형 AI factory 구성을 지원합니다.

섹션별 상세

01
AI 추론의 병목이 학습용 연산량에서 긴 문맥을 처리하고 토큰을 빠르게 생성하는 서비스 인프라로 이동하면서, 단일 칩보다 AI factory의 모든 계층을 함께 설계하는 접근이 필요해졌습니다. NVIDIA는 Vera Rubin NVL72, Spectrum-X Ethernet, NVIDIA Groq 3 LPX를 연산·네트워크·추론 가속 계층으로 결합해 에이전트형 AI의 응답성과 처리량을 높이는 구성을 내놓았습니다. Artificial Analysis의 Gemma 4 31B benchmark에서는 100,000토큰 장문맥 조건에서 초당 3,400 output tokens를 기록해 가장 가까운 대안 플랫폼보다 4배 빠른 수치가 제시됐습니다.
NVIDIA Vera CPU의 실리콘 다이와 패키지 기판을 클로즈업한 이미지입니다.
Screenshot이미지는 Vera CPU의 중앙 연산 블록과 주변 패키지 연결부를 시각적으로 보여줍니다. 본문에서 Vera CPU가 에이전트형 AI의 orchestration, tool use, code execution, data processing, simulation 같은 CPU 중심 작업을 가속한다고 밝힌 내용과 연결됩니다.
여러 AI 서버 랙과 랙 사이를 연결하는 케이블·배관 구조를 상부 시점에서 표현한 이미지입니다.
Diagram이미지는 다수의 랙이 병렬 연결된 AI factory의 물리적 규모와 데이터·전력·냉각 인프라의 집적을 강조합니다. 본문에서 Vera Rubin, Spectrum-X Ethernet, LPX를 compute·networking·inference 계층으로 공동 설계하고 대규모 AI factory로 확장하는 맥락과 연결됩니다.
여러 AI 데이터센터 블록과 그 위에 배치된 사용자·에이전트 아이콘을 연결한 개념 이미지입니다.
Diagram이미지는 다수의 AI factory가 네트워크로 연결되고 여러 사용자와 에이전트가 동시에 서비스를 이용하는 구조를 표현합니다. 에이전트형 AI가 다른 AI 시스템, 데이터 소스, 서비스와 상호작용하면서 긴 문맥과 빠른 추론을 요구한다는 본문의 workload 설명과 직접 연결됩니다.
근거
  • NVIDIA Groq 3 LPX가 Gemma 4 31B의 100,000토큰 장문맥 조건에서 초당 3,400 output tokens를 기록했고 가장 가까운 대안 플랫폼보다 4배 빠른 수치를 냈다. 기사 도입부의 Artificial Analysis benchmark 문단 출처
02
Vera Rubin NVL72는 긴 시퀀스를 처리하는 GPU 플랫폼으로, NVIDIA Groq 3 LPX는 에이전트가 응답을 한 토큰씩 생성할 때 발생하는 decode latency를 낮추는 역할을 맡습니다. Rubin GPU가 대규모 context processing을 담당하고 LPX가 latency-sensitive decode workload를 가속하는 방식으로 두 장치의 역할을 분리합니다. 이 결합은 긴 추론 체인에서 지연이 누적되는 문제를 줄이면서 대규모 inference throughput과 사용자 체감 응답성을 함께 확보하려는 구조입니다.
Hopper NVL8, Blackwell NVL72, Vera Rubin NVL72, LPX의 사용자 상호작용과 전력당 초당 토큰 처리량을 비교한 차트입니다.
Chart차트의 세로축은 TPS per MW, 가로축은 User Interactivity이며 LPX가 낮은 지연시간 추론을 겨냥한 별도 곡선으로 표시됩니다. 본문이 에이전트형 AI에서 토큰 생성 속도와 응답성을 핵심 성능 기준으로 삼고 NVIDIA Groq 3 LPX를 Vera Rubin NVL72의 보완 가속기로 배치하는 이유를 시각적으로 연결합니다.
근거
  • NVIDIA Groq 3 LPX는 Rubin GPU의 context processing과 LPX의 decode acceleration을 결합해 에이전트 workload의 지연시간을 낮춘다. NVIDIA Groq 3 LPX 섹션의 Interactive AI Inference Accelerator 문단
03
NVIDIA Groq 3 LPX는 Rubin GPU와 LPU를 함께 사용하고, 여러 LPU를 결정적 추론에 맞춘 하나의 대형 프로세서처럼 운용하도록 설계됐습니다. 랙 단위 배포에는 LP30 accelerator 256개가 direct chip-to-chip link로 연결될 수 있어, 토큰 생성에 특화된 inference engine을 구성합니다. Nebius는 이를 Token Factory에 처음 도입해 coding system과 실시간 AI 애플리케이션을 위한 빠른 토큰 생성을 제공할 계획입니다.
근거
  • 랙 단위 NVIDIA Groq 3 LPX 배포에는 direct chip-to-chip links로 연결된 LP30 accelerator 256개가 포함될 수 있다. Extreme Codesign for Inference 섹션의 랙 구성 문단
04
Spectrum-X Multiplane은 서버의 네트워크 연결을 여러 독립 경로인 plane으로 나누고, 각 plane에 가벼운 2계층 네트워크를 구성해 세 번째 네트워크 계층 없이 규모를 확장합니다. ConnectX SuperNIC 내부의 전용 하드웨어 엔진이 plane 사이의 트래픽을 관리하고 장애가 발생하면 즉시 다른 경로로 우회하므로 애플리케이션에는 하나의 연결로 보입니다. 최대 512,000 GPU까지 확장할 수 있으며, 8-plane topology에서 한 plane이 고장 나도 전체 대역폭의 약 90%를 유지하고 software 기반 방식보다 hardware recovery가 11배 빠르다는 수치가 제시됐습니다.
근거
  • Spectrum-X Multiplane은 최대 512,000 GPU까지 세 번째 네트워크 계층 없이 확장하고, 8-plane topology에서 한 plane 장애 뒤 약 90%의 총 대역폭을 유지한다. Multiplane Unlocks Scale Without the Tradeoffs of a New Tier 섹션 출처
  • Spectrum-X Ethernet은 범용 Ethernet보다 1.6배 높은 AI networking performance를 제공하며, Spectrum-XGS Ethernet은 다중 사이트 NCCL collectives를 1.9배 가속한다. Spectrum-X Ethernet 플랫폼 및 Built Through Extreme Codesign 섹션
05
NVIDIA Scale-In은 AI factory의 보안, 네트워크, 스토리지 접근, 탄력적 프로비저닝, 실시간 관측성을 호스트 연산과 분리해 처리하는 네트워크 인프라 계층입니다. BlueField-4 processor와 DOCA software를 Spectrum-X Ethernet으로 연결해 기존 north-south access network를 가속된 통합 인프라 영역으로 전환합니다. 에이전트와 애플리케이션, 데이터, 서비스의 상호작용이 늘어나는 환경에서 인프라 운영 기능도 AI 연산과 같은 규모로 확장하도록 설계됐습니다.
데이터센터 랙 이미지와 서버 보드 위 BlueField-4 프로세서 구성을 함께 배치한 이미지입니다.
Diagram이미지는 AI factory의 랙 규모 인프라와 개별 네트워크·보안 프로세서가 한 구성 안에서 연결되는 모습을 나타냅니다. BlueField-4와 DOCA가 네트워크, 스토리지 접근, 보안, 운영 처리를 호스트 연산과 분리해 가속한다는 Scale-In 섹션의 구조와 관련됩니다.
06
NVLink Fusion은 custom XPU와 CPU를 NVIDIA의 scale-up·scale-out 기술 스택에 연결해 반도체 구성을 유연하게 조합하도록 지원합니다. sixth-generation NVIDIA NVLink, NVLink Switch, NVLink-C2C, NVIDIA MGX rack 설계를 활용하면 GPU와 XPU가 전력·냉각·네트워크·관리 시스템을 공유하면서 공급과 workload에 따라 비율을 조정할 수 있습니다. 이 구조는 custom silicon 기업과 hyperscaler가 차별화된 칩을 개발하면서도 NVIDIA의 컴퓨팅, 네트워킹, 인프라, 소프트웨어 생태계를 사용할 수 있게 합니다.
서로 다른 구성의 AI 서버 랙 다섯 대를 나란히 배치한 이미지입니다.
Diagram이미지는 여러 랙 설계가 하나의 AI factory 제품군으로 구성될 수 있음을 시각적으로 나타냅니다. 본문에서 NVIDIA가 Vera Rubin NVL72를 기반으로 LPX, 네트워크, 소프트웨어를 결합해 workload와 공급 조건에 맞는 확장형 인프라를 구축하려는 방향과 관련됩니다.
근거
  • NVLink Fusion은 custom XPU와 CPU를 NVIDIA의 scale-up·scale-out 스택에 연결하고 GPU와 XPU가 랙 인프라를 공유하도록 한다. NVIDIA NVLink Fusion Connects XPUs to NVIDIA’s Leading AI Platform 섹션

용어 해설

에이전트형 AI(Agentic AI)
사용자 요청에 답하는 데 그치지 않고 여러 단계의 추론, 도구 사용, 코드 실행, 데이터 접근을 연속적으로 수행하는 AI 시스템입니다. 각 단계에서 토큰을 생성하고 다른 AI 시스템이나 외부 서비스와 상호작용하므로 긴 문맥 처리와 낮은 decode latency가 중요합니다.
디코드 지연시간(Decode Latency)
언어 모델이 응답을 한 토큰씩 생성하는 과정에서 발생하는 지연시간입니다. 에이전트가 도구를 호출하거나 다른 시스템과 여러 차례 상호작용하면 작은 지연도 연쇄적으로 누적되므로, 대규모 처리량과 별도로 낮고 예측 가능한 지연시간을 확보해야 합니다.
극단적 공동 설계(Extreme Codesign)
GPU, CPU, 네트워크, 가속기, 소프트웨어를 개별적으로 최적화하지 않고 AI factory 전체를 하나의 시스템으로 설계하는 방식입니다. Vera Rubin, Spectrum-X, Groq 3 LPX처럼 연산·통신·추론 계층을 함께 구성해 처리량, 응답성, 비용 효율을 동시에 높이는 데 목적이 있습니다.
토큰 공장(Token Factory)
모델 학습보다 대규모 추론 서비스에 초점을 맞춘 인프라 개념입니다. 긴 문맥을 읽고 토큰을 빠르게 생성하며 여러 사용자와 에이전트의 요청을 지속적으로 처리해 성능, 처리량, 지능의 일관성, 경제성을 함께 확보하는 구조를 가리킵니다.
Scale-In 인프라(Scale-In)
AI 연산 자체뿐 아니라 네트워킹, 스토리지 접근, 보안, 프로비저닝, 관측성 같은 인프라 서비스를 가속하는 NVIDIA의 네트워크 인프라 계층입니다. BlueField-4와 DOCA를 Spectrum-X Ethernet에 연결해 호스트 연산 자원을 소모하지 않고 공유 AI factory의 운영 기능을 처리합니다.

기술

  • NVIDIA Vera Rubin NVL72
  • NVIDIA Groq 3 LPX
  • NVIDIA Vera CPUs
  • NVIDIA Spectrum-X Multiplane
  • NVIDIA Spectrum-X Ethernet
  • NVIDIA Spectrum-XGS Ethernet
  • NVIDIA ConnectX SuperNIC
  • ConnectX-9 SuperNICs
  • Spectrum-X SN6000 series switches
  • Spectrum-6 Ethernet ASIC
  • NVIDIA Scale-In
  • NVIDIA BlueField-4
  • NVIDIA DOCA
  • NVIDIA NVLink Fusion
  • sixth-generation NVIDIA NVLink
  • NVLink Switch
  • NVLink-C2C
  • NVIDIA MGX
  • NCCL

활용 사례

  • 100,000토큰 장문맥 agentic AI
  • 실시간 AI 애플리케이션
  • coding systems
  • 다중 에이전트 추론
  • 대규모 AI cloud infrastructure
  • 공유형 multi-tenant AI factory
  • custom XPU·CPU 기반 semi-custom AI factory
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 25.수집 2026. 08. 25.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.