본문으로 건너뛰기

Arm의 C2-Ultra, G2-Ultra NX 및 CSS N4 IP

Arm의 새 CPU·GPU·서버 IP가 성능 개선을 내세웠지만 세부 설계와 비교 조건 공개는 부족했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Arm은 모바일용 C2-Ultra CPU와 G2-Ultra NX GPU, 데이터센터용 Neoverse CSS N4 IP를 공개했습니다. C2-Ultra는 분기 예측과 실행 창을 개선하고 더 큰 L2 캐시와 높은 클록을 조합해 C1-Ultra 대비 최대 성능 15%, 평균 성능 12% 향상을 내세웠지만, 클록 상승을 제외하면 평균 향상은 3.2%였고 Arm이 정정한 최대 IPC 향상은 7%였습니다. G2-Ultra NX는 레지스터 접근량과 캐시 효율을 높이고 Ray Tracing 유닛과 Matrix Accelerator를 추가했지만, 행렬 가속기가 INT8과 INT16만 지원해 FP8과 BF16 활용에는 제약이 있습니다. Neoverse CSS N4는 코어 8~128개, 최대 3.8GHz, 코어당 최대 2MB L2와 다이당 최대 256MB 공유 캐시를 제공하지만, Arm의 발표 자료만으로는 핵심 마이크로아키텍처와 일부 인터페이스 구성이 확인되지 않습니다.

섹션별 상세

01
C2-Ultra는 Cortex X925와 비교해 10-wide 디코드, 8개 단순 ALU, 6개 FP 레인, 3개 분기 포트, 4로드·2스토어 구성을 그대로 유지하고 핵심 구조를 반복 개선하는 접근을 취했습니다. Arm은 분기 예측기와 비순차 실행 창, 추측 실행을 개선했다고 밝혔지만 BTB 크기나 반환 스택, 분기 알고리즘이 어떻게 바뀌었는지는 공개하지 않았습니다. 그 결과 C2-Ultra는 C1-Ultra보다 데이터 대기 시간을 줄이는 방향을 취했지만, 마이크로아키텍처 자체의 기여도는 발표 자료만으로 분리하기 어려운 상태입니다.
02
C2-Ultra의 성능 수치는 FPGA 시뮬레이션에서 산출됐고, 비교 플랫폼에는 C1-Ultra보다 8.5% 높은 클록과 더 큰 3MB L2 캐시가 적용됐습니다. Arm은 CPU 벤치마크에서 메모리 시스템 대역폭이 거의 두 배가 됐지만 이 개선을 성능 향상 수치에 포함하지 않았다고 밝혔으며, 클록 상승을 제외한 평균 향상은 3.2%, 정정된 최대 IPC 향상은 7%였습니다. 따라서 발표된 최대 15% 성능 향상은 실제 하드웨어와 동일 클록·동일 메모리 조건에서 그대로 재현된다고 보기 어렵고, 일부 워크로드는 추가 L2 캐시의 영향을 받았을 가능성이 남습니다.
03
C2-Ultra는 C1-Ultra보다 전력 사용량이 38% 낮다고 제시됐지만, 이 수치에는 공정과 구현 개선도 함께 포함됐습니다. 코어 구조 변경이 전력 감소에 기여한 비중을 따로 산출하지 않았기 때문에, 새로운 분기 예측과 실행 구조가 만든 효율 개선을 해당 수치에서 분리할 수 없습니다. C2-Nano와 C2-Pro는 별도로 발표됐지만 C1-Nano와 C1-Pro의 기본 마이크로아키텍처를 그대로 사용합니다.
04
G2-Ultra NX는 Shader Core의 연산량과 최대 24개 코어 구성은 유지하면서 워프가 접근할 수 있는 레지스터를 64개에서 128개로 늘리고 레지스터 할당 단위를 16개로 세분화했습니다. 레지스터 파일도 25% 커졌으며, Ray Tracing 유닛은 삼각형 구조에서 중복 데이터를 제거해 DRAM 트래픽을 13% 줄였고 Opacity Micromaps를 추가했습니다. 이런 변화는 캐시 적중과 메모리 효율을 높이는 방식이지만, Arm이 제시한 게임 성능 최대 14%와 Ray Tracing 벤치마크 최대 24%에는 G1-Ultra보다 약 11% 높은 클록도 포함됩니다.
05
G2-Ultra NX의 Matrix Accelerator는 Shader Core에 통합되어 클록당 최대 1,024 INT8 MAC 또는 512 INT16 MAC을 처리하고 Execution Engine보다 최대 두 배 높은 클록으로 동작할 수 있습니다. 다만 FP8과 BF16을 지원하지 않고, 모든 Shader Core에 가속기를 탑재할 필요도 없어 Xiaomi의 XRING O3 구현에서는 절반의 Shader Core만 Matrix Accelerator를 사용했습니다. 가속기 탑재 코어의 면적은 약 1.88mm², 미탑재 코어는 약 1.55mm²로 측정돼 행렬 유닛이 Shader Core 면적을 약 21% 늘리며, Arm은 이를 기반으로 Neural Super Sampling과 Frame Rate 업스케일링 기능을 추가했습니다.
06
Neoverse CSS N4는 데이터센터 파트너를 대상으로 코어 수와 연결 구성을 넓힌 서버용 IP입니다. 한 다이에 Neoverse N4 코어를 8~128개 배치하고 최대 3.8GHz로 동작하며, 코어당 64KB 명령어 캐시와 64KB 데이터 캐시, 최대 2MB 전용 L2 캐시, 다이당 최대 256MB 공유 캐시를 제공합니다. DDR5 또는 LPDDR6, 최대 128개 PCIe Gen 6/7 및 CXL 4.0 레인, UCIe 또는 파트너별 PHY를 지원하지만, 사용 코어의 구체적 정체와 단일 다이의 메모리 버스 폭·PCIe 레인 수는 공개되지 않았습니다.
07
이번 발표의 핵심 한계는 성능·전력 수치와 구조 변경을 동일한 조건에서 분리하지 않았다는 점입니다. C2-Ultra는 높은 클록, 추가 L2 캐시, 메모리 시스템 개선이 함께 적용됐고 전력 수치에는 공정·구현 개선까지 포함돼 마이크로아키텍처의 효과를 직접 비교하기 어렵습니다. G2-Ultra NX와 CSS N4도 일부 세부 사항은 후속 질의로 보완됐기 때문에, 제품의 실제 차이를 평가하려면 Arm이 발표 단계에서 동일 클록과 메모리 구성, 핵심 설계 정보를 함께 제공해야 합니다.

용어 해설

비순차 실행(Out-of-Order Execution)
프로세서가 프로그램 명령어의 원래 순서를 그대로 기다리지 않고, 입력 데이터가 준비된 명령어부터 실행하는 방식입니다. 실행 창과 버퍼가 커지면 대기 시간을 줄이고 병렬성을 높일 수 있지만, 분기 예측과 레지스터 관리 구조가 함께 뒷받침되어야 성능 향상으로 이어집니다.
Ray Tracing 유닛(Ray Tracing Unit)
3D 장면에서 광선과 삼각형의 교차를 계산해 그림자와 반사 같은 효과를 처리하는 GPU 전용 연산 블록입니다. G2-Ultra NX는 삼각형 구조를 더 작게 만들어 중복 데이터를 줄이고 DRAM 트래픽을 13% 낮추는 방향으로 이 유닛을 개선했습니다.
행렬 가속기(Matrix Accelerator)
행렬 곱셈과 누산을 병렬 처리해 머신러닝 연산을 빠르게 수행하는 하드웨어 블록입니다. G2-Ultra NX의 가속기는 Shader Core에 통합되어 클록당 최대 1,024 INT8 MAC 또는 512 INT16 MAC을 처리하지만 FP8과 BF16은 지원하지 않습니다.
칩렛(Chiplet)
하나의 대형 칩을 여러 개의 작은 다이로 나누고 고속 인터커넥트로 연결하는 설계 방식입니다. Neoverse CSS N4는 멀티칩렛과 멀티소켓 구성을 지원해 단일 다이를 넘어 서버 시스템을 확장할 수 있도록 설계됐습니다.

기술

  • Cortex X925
  • C2-Ultra
  • C2-Nano
  • C2-Pro
  • G2-Ultra NX
  • G1-Ultra
  • Neural Super Sampling
  • Opacity Micromaps
  • Neoverse CSS N4
  • DDR5
  • LPDDR6
  • PCIe Gen 6/7
  • CXL 4.0
  • UCIe
  • XRING O3
  • Exynos 2600

활용 사례

  • 플래그십 스마트폰 CPU
  • 모바일 게임 그래픽
  • 모바일 Ray Tracing
  • 머신러닝 기반 업스케일링
  • 데이터센터 서버 CPU
  • 멀티칩렛·멀티소켓 서버
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 08.수집 2026. 09. 09.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.