TL;DR
AI inference가 학습 이후의 핵심 경쟁 영역으로 이동하면서 NVIDIA는 Vera Rubin NVL72, Groq 3 LPX, Spectrum-X Ethernet을 하나의 AI factory로 공동 설계하는 전략을 내놓았습니다. Groq 3 LPX는 Rubin GPU가 처리한 긴 문맥을 바탕으로 토큰을 한 개씩 생성하는 decode workload를 가속하며, Gemma 4 31B benchmark에서 100,000토큰 문맥 기준 초당 3,400 output tokens와 대안 플랫폼 대비 4배 빠른 결과를 기록했습니다. Spectrum-X Multiplane은 서버 연결을 여러 독립 plane으로 분할해 최대 512,000 GPU까지 확장하고 장애 시 대역폭을 유지하며, BlueField-4 기반 Scale-In은 보안·스토리지·운영 기능을 호스트 연산과 분리합니다. NVLink Fusion은 custom XPU와 CPU를 NVIDIA의 네트워크·랙·소프트웨어 생태계에 연결해 에이전트형 AI를 위한 반맞춤형 AI factory 구성을 지원합니다.
섹션별 상세



- NVIDIA Groq 3 LPX가 Gemma 4 31B의 100,000토큰 장문맥 조건에서 초당 3,400 output tokens를 기록했고 가장 가까운 대안 플랫폼보다 4배 빠른 수치를 냈다. — 기사 도입부의 Artificial Analysis benchmark 문단 출처

- NVIDIA Groq 3 LPX는 Rubin GPU의 context processing과 LPX의 decode acceleration을 결합해 에이전트 workload의 지연시간을 낮춘다. — NVIDIA Groq 3 LPX 섹션의 Interactive AI Inference Accelerator 문단
- 랙 단위 NVIDIA Groq 3 LPX 배포에는 direct chip-to-chip links로 연결된 LP30 accelerator 256개가 포함될 수 있다. — Extreme Codesign for Inference 섹션의 랙 구성 문단
- Spectrum-X Multiplane은 최대 512,000 GPU까지 세 번째 네트워크 계층 없이 확장하고, 8-plane topology에서 한 plane 장애 뒤 약 90%의 총 대역폭을 유지한다. — Multiplane Unlocks Scale Without the Tradeoffs of a New Tier 섹션 출처
- Spectrum-X Ethernet은 범용 Ethernet보다 1.6배 높은 AI networking performance를 제공하며, Spectrum-XGS Ethernet은 다중 사이트 NCCL collectives를 1.9배 가속한다. — Spectrum-X Ethernet 플랫폼 및 Built Through Extreme Codesign 섹션


- NVLink Fusion은 custom XPU와 CPU를 NVIDIA의 scale-up·scale-out 스택에 연결하고 GPU와 XPU가 랙 인프라를 공유하도록 한다. — NVIDIA NVLink Fusion Connects XPUs to NVIDIA’s Leading AI Platform 섹션
용어 해설
- 에이전트형 AI(Agentic AI)
- — 사용자 요청에 답하는 데 그치지 않고 여러 단계의 추론, 도구 사용, 코드 실행, 데이터 접근을 연속적으로 수행하는 AI 시스템입니다. 각 단계에서 토큰을 생성하고 다른 AI 시스템이나 외부 서비스와 상호작용하므로 긴 문맥 처리와 낮은 decode latency가 중요합니다.
- 디코드 지연시간(Decode Latency)
- — 언어 모델이 응답을 한 토큰씩 생성하는 과정에서 발생하는 지연시간입니다. 에이전트가 도구를 호출하거나 다른 시스템과 여러 차례 상호작용하면 작은 지연도 연쇄적으로 누적되므로, 대규모 처리량과 별도로 낮고 예측 가능한 지연시간을 확보해야 합니다.
- 극단적 공동 설계(Extreme Codesign)
- — GPU, CPU, 네트워크, 가속기, 소프트웨어를 개별적으로 최적화하지 않고 AI factory 전체를 하나의 시스템으로 설계하는 방식입니다. Vera Rubin, Spectrum-X, Groq 3 LPX처럼 연산·통신·추론 계층을 함께 구성해 처리량, 응답성, 비용 효율을 동시에 높이는 데 목적이 있습니다.
- 토큰 공장(Token Factory)
- — 모델 학습보다 대규모 추론 서비스에 초점을 맞춘 인프라 개념입니다. 긴 문맥을 읽고 토큰을 빠르게 생성하며 여러 사용자와 에이전트의 요청을 지속적으로 처리해 성능, 처리량, 지능의 일관성, 경제성을 함께 확보하는 구조를 가리킵니다.
- Scale-In 인프라(Scale-In)
- — AI 연산 자체뿐 아니라 네트워킹, 스토리지 접근, 보안, 프로비저닝, 관측성 같은 인프라 서비스를 가속하는 NVIDIA의 네트워크 인프라 계층입니다. BlueField-4와 DOCA를 Spectrum-X Ethernet에 연결해 호스트 연산 자원을 소모하지 않고 공유 AI factory의 운영 기능을 처리합니다.
기술
- NVIDIA Vera Rubin NVL72
- NVIDIA Groq 3 LPX
- NVIDIA Vera CPUs
- NVIDIA Spectrum-X Multiplane
- NVIDIA Spectrum-X Ethernet
- NVIDIA Spectrum-XGS Ethernet
- NVIDIA ConnectX SuperNIC
- ConnectX-9 SuperNICs
- Spectrum-X SN6000 series switches
- Spectrum-6 Ethernet ASIC
- NVIDIA Scale-In
- NVIDIA BlueField-4
- NVIDIA DOCA
- NVIDIA NVLink Fusion
- sixth-generation NVIDIA NVLink
- NVLink Switch
- NVLink-C2C
- NVIDIA MGX
- NCCL
활용 사례
- 100,000토큰 장문맥 agentic AI
- 실시간 AI 애플리케이션
- coding systems
- 다중 에이전트 추론
- 대규모 AI cloud infrastructure
- 공유형 multi-tenant AI factory
- custom XPU·CPU 기반 semi-custom AI factory
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.