본문으로 건너뛰기

NVIDIA Vera CPU의 에이전틱 플릿 균형 설계

Vera CPU는 긴 순차 추론과 짧은 병렬 팬아웃을 한 CPU에서 처리해 에이전트 세션 완료량을 높이는 구조입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

AI 에이전트 세션은 대부분 서로 다른 실행 궤적을 만들며, 긴 순차 추론 경로 사이에 짧은 도구 호출과 하위 에이전트 병렬 버스트가 끼어드는 형태입니다. NVIDIA Vera CPU는 NVIDIA Olympus 코어의 강한 개별 Thread 성능, 넓은 프런트엔드, 깊은 비순차 실행, 높은 메모리 대역폭을 결합해 순차 임계 경로와 팬아웃 동시성을 한 플랫폼에서 처리하도록 설계됐습니다. NVIDIA 내부 2026년 7월 추정 SPEC CPU 2026 결과에서는 네 가지 작업에서 AMD Venice 대비 코어당 최대 1.5배 성능이 제시됐습니다. 일부 코어를 꺼 단일 Thread 성능을 높이면 최대 1.5TB 메모리가 유휴 상태가 될 수 있어, 이 글은 코어 수보다 완료한 에이전트 세션과 전체 자원 활용률을 플릿 최적화 기준으로 삼습니다.

빠른 이해

새로운 점

에이전틱 세션의 순차 임계 경로와 일시적 팬아웃을 하나의 CPU 설계 지점에서 함께 처리해 플릿을 구성하려는 접근입니다.

핵심 메커니즘

에이전트 요청의 순차 추론·도구 호출은 NVIDIA Olympus 코어의 강한 개별 Thread 성능으로 처리하고, 검색·샌드박스·하위 에이전트의 병렬 팬아웃은 여러 코어의 동시성과 높은 메모리 대역폭으로 흡수하는 구조입니다.

핵심 수치

  • 프로파일링 에이전틱 세션: 163,594개- NVIDIA가 제시한 실제 세션 텔레메트리
  • 고유 궤적 프로필 비율: 97% 초과- 프로파일링된 세션 중 고유한 프로필을 보인 비율
  • 메모리 용량 활용 손실 예: 최대 1.5TB- 일부 코어를 꺼 단일 Thread 성능을 높이는 경우
  • 코어당 성능: NVIDIA Vera CPU 최대 1.5x vs AMD Venice- NVIDIA 내부 2026년 7월 측정 및 추정 SPEC CPU 2026 비교

섹션별 상세

01

에이전트 세션의 불규칙성

AI 팩토리에서 GPU가 모델을 실행하는 동안 CPU는 에이전트 오케스트레이션, 도구 실행, 샌드박스 계산을 맡습니다. NVIDIA가 수집한 163,594개 에이전틱 세션 텔레메트리에서는 97%가 넘는 세션이 서로 다른 궤적 프로필을 나타내 하나의 고정된 실행 패턴으로 CPU 플릿을 맞추기 어려웠습니다. 세션마다 추론 단계, 도구 호출, 재시도, 병렬 하위 작업의 조합이 달라지기 때문에 특정 도구 호출에 맞춘 여러 CPU 설계 지점을 나누는 방식은 비효율적입니다. 따라서 핵심 기준은 이론적인 코어 수가 아니라 주어진 전력과 메모리로 얼마나 많은 사용자 세션을 끝내는지에 놓입니다.
에이전트 요청이 도구 호출, 재시도, 병렬 작업, 하위 에이전트 분기로 이어진 뒤 완료되는 여러 궤적을 나타낸 도식입니다.
Diagram도식은 하나의 에이전트 세션이 단일 순차 흐름이 아니라 여러 도구 호출과 병렬 분기를 거쳐 서로 다른 완료 경로를 만들 수 있음을 나타냅니다. 본문의 163,594개 세션 중 97% 초과가 고유한 프로필을 보였다는 텔레메트리와 연결되며, 고정된 작업 유형별 CPU 플릿보다 순차 성능과 동시성을 함께 갖춘 설계가 필요한 이유를 뒷받침합니다.
02

길이와 폭으로 나뉘는 실행 궤적

에이전트 궤적의 길이는 요청이 완료될 때까지 필요한 추론 단계, 도구 호출, 재시도, 하위 작업의 수를 뜻하고 폭은 각 단계에서 동시에 분기되는 작업량을 뜻합니다. 순차적인 주 경로가 계속 이어지는 동안 도구 호출, 검색, 샌드박스, 하위 에이전트가 짧은 병렬 폭을 만들기 때문에 한 세션은 높은 폭을 가져도 대부분의 시간은 임계 경로에서 소비할 수 있습니다. 병렬 작업이 끝나야 주 에이전트가 다음 단계로 넘어가므로 팬아웃 구간에서도 각 Thread의 지연 시간이 전체 완료 시간에 영향을 줍니다. CPU는 병렬 작업을 수용할 충분한 동시성과 순차 경로를 빠르게 통과시킬 강한 코어 성능을 동시에 제공해야 합니다.
에이전트 요청의 실행 궤적에서 순차 단계의 길이와 동시에 분기되는 작업의 폭을 구분한 도식입니다.
Diagram도식에서 길이는 추론 단계와 도구 호출이 이어지는 전체 순차 깊이를, 폭은 여러 작업이 동시에 실행되는 분기 규모를 나타냅니다. 주 에이전트가 병렬 작업의 완료를 기다린 뒤 다음 단계로 이동하므로 폭이 커도 개별 Thread 지연 시간이 중요하다는 본문의 논리를 시각적으로 연결합니다.
03

실제 세션의 순차 경로와 버스트

본문의 Claude Code 세션 사례에서는 약 33분 동안 주 에이전트가 긴 순차 궤적을 따라가고 하위 에이전트가 짧은 병렬 작업 버스트를 만드는 패턴이 나타났습니다. 입력 토큰 그래프에서 주 에이전트의 작업량은 시간에 따라 길게 누적되는 반면 하위 에이전트는 짧고 높은 봉우리로 나타나 두 실행 형태의 차이를 드러냅니다. 코어를 순차 작업의 단일 Thread 성능 향상에만 사용하면 병렬 구간을 처리할 자원이 부족하고, 반대로 코어 수만 늘리면 임계 경로의 지연 시간이 길어질 수 있습니다. NVIDIA는 두 구간을 하나의 CPU에서 처리해야 전체 사용자 턴 완료량과 플릿 효율을 높일 수 있다고 설명합니다.
약 33분 동안 주 에이전트의 긴 순차 실행과 하위 에이전트의 짧고 높은 병렬 입력 토큰 버스트를 비교한 선 그래프입니다.
Chart검은색 선은 주 에이전트의 입력 토큰이 긴 시간 동안 누적되는 순차 경로를, 녹색 봉우리는 짧은 시간에 집중되는 하위 에이전트 팬아웃을 나타냅니다. 이 패턴은 CPU가 긴 임계 경로에는 낮은 지연 시간을 제공하고 짧은 버스트에는 충분한 Thread 동시성을 제공해야 한다는 설계 요구와 직접 연결됩니다.
04

Vera CPU의 균형 설계

NVIDIA Vera CPU는 CPU 전체가 활성화된 상태에서도 개별 Thread 성능을 유지하도록 NVIDIA Olympus 코어를 구성하고, 넓은 프런트엔드와 고도화된 분기 예측, 깊은 비순차 실행, 높은 메모리 대역폭을 결합합니다. 이 구조는 큰 코드 영역, 분기가 많은 제어 흐름, 동적 런타임, 데이터 의존성이 큰 작업에서 각 코어가 실행 가능한 작업을 계속 찾도록 처리 경로를 구성합니다. 동시에 여러 코어가 도구 호출과 하위 에이전트의 팬아웃을 받아들이므로 순차 경로와 병렬 버스트를 별도 CPU 설계로 분리할 필요가 줄어듭니다. 단일 설계 지점에서 코어 활용률과 메모리 사용률을 함께 높이는 것이 Vera CPU가 겨냥한 AI 팩토리 운영 방식입니다.
05

메모리와 플릿 비용의 관계

CPU가 단일 Thread 성능을 높이기 위해 일부 코어를 끄면 코어 하나당 연결된 8GB 메모리가 사용되지 않을 수 있으며, 그림은 256코어 시스템에서 64코어만 활성화할 때 192코어와 연결 메모리가 유휴 상태가 되는 상황을 나타냅니다. 제시된 예에서는 이 방식으로 최대 1.5TB의 메모리 용량이 활용되지 않을 수 있어 코어 성능만으로 최적화를 판단하면 메모리 총소유비용을 놓치게 됩니다. Vera CPU는 전체 소켓 부하에서 강한 개별 코어 성능을 유지하는 방향으로 설계해 순차 작업 중에도 코어와 연결 메모리를 계속 활용하려 합니다. 이 접근은 전력, DRAM, GPU HBM, 전체 메모리 계층을 실제 완료 세션 수와 연결해 플릿 경제성을 평가하게 합니다.
256코어 CPU에서 64개 코어만 활성화되고 192개 코어가 유휴 상태일 때 코어당 8GB 메모리와 총 1.5TB 메모리가 충분히 활용되지 않는 상황을 나타낸 도식입니다.
Diagram활성 코어 64개와 유휴 코어 192개의 대비는 단일 Thread 성능을 높이기 위해 코어를 끌 때 연결된 메모리 용량도 함께 묶일 수 있음을 나타냅니다. 본문이 코어 수나 순간적인 단일 코어 성능보다 전체 궤적에서 코어와 메모리를 지속적으로 활용하는 균형 설계를 강조하는 근거입니다.
06

내부 성능 추정과 비교

NVIDIA가 2026년 7월 내부에서 측정한 추정 SPEC CPU 2026 결과에서는 Vera CPU가 AMD Venice보다 723.lbm_r, 727.cpepcchk_r, 721.gcc_r, 714.cpython_r 네 작업에서 코어당 최대 1.5배 성능으로 표시됐습니다. 비교 차트는 AMD Venice 9996을 1배 기준으로 두고 NVIDIA Vera CPU를 네 작업 모두 1.5배로 나타내며 컴파일러, 정적 분석, Python 계열 부하를 포함합니다. AMD Venice 수치는 SPECrate 2026 정수 기본 점수 2070을 바탕으로 구성 요소를 내부 Turin 측정값에 맞춰 정규화한 추정치이고, NVIDIA Vera CPU 결과도 내부 측정과 특정 구성에 기반하므로 실제 결과는 달라질 수 있습니다. 이 수치는 Vera CPU가 전체 소켓 부하에서 동시성을 유지하면서 에이전트 임계 경로에 필요한 코어당 성능을 확보하려는 설계 목표를 뒷받침합니다.
AMD Venice 9996을 1배로 두고 NVIDIA Vera CPU를 723.lbm_r, 727.cpepcchk_r, 721.gcc_r, 714.cpython_r에서 1.5배로 표시한 코어당 성능 비교 막대그래프입니다.
Chart그래프는 네 가지 SPEC CPU 2026 작업에서 NVIDIA Vera CPU의 추정 코어당 성능을 AMD Venice 9996 대비 1.5배로 표시합니다. 본문은 이 결과가 2026년 7월 NVIDIA 내부 측정과 AMD Venice 점수의 정규화 추정에 기반하며, 실제 성능은 측정 구성에 따라 달라질 수 있다고 명시합니다.

용어 해설

에이전틱 워크로드(Agentic Workload)
AI 에이전트가 추론 단계마다 도구 호출, 검색, 재시도, 샌드박스 실행, 하위 에이전트 작업을 이어 가는 실행 패턴입니다. 순차 경로와 일시적인 병렬 작업이 함께 나타나 CPU의 지연 시간과 동시성 설계를 동시에 요구합니다.
임계 경로(Critical Path)
에이전트 작업에서 다음 단계가 시작되기 전에 반드시 완료되어야 하는 순차 의존 경로입니다. 이 경로의 실행 시간이 전체 세션 완료 시간을 좌우하므로 개별 Thread의 지연 시간을 낮추는 것이 중요합니다.
팬아웃(Fan-Out)
하나의 에이전트 단계가 여러 도구 호출, 검색 작업 또는 하위 에이전트 작업으로 분기되는 실행 형태입니다. 짧은 시간에 많은 Thread가 필요하지만 병렬 구간 자체는 일시적이어서 높은 동시성과 빠른 개별 실행을 함께 요구합니다.
비순차 실행(Out-of-Order Execution)
CPU가 명령어의 원래 순서를 그대로 기다리지 않고 실행 가능한 명령어부터 처리하는 방식입니다. 분기와 데이터 의존성이 복잡한 코드에서도 유휴 시간을 줄여 각 코어가 더 오래 작업을 진행하도록 돕습니다.
총소유비용(Total Cost of Ownership)
CPU와 메모리, 전력, 운영에 필요한 전체 비용을 합산한 지표입니다. 이 글에서는 코어 수만 늘리는 대신 실제로 완료한 에이전트 세션 수와 메모리 활용률까지 함께 고려해야 AI 팩토리의 비용 효율을 판단할 수 있다고 봅니다.

기술

  • NVIDIA Vera CPU
  • NVIDIA Olympus
  • AMD Venice
  • Claude Code
  • SPEC CPU 2026
  • SPECrate 2026

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 08. 25.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.