TL;DR
Arm은 모바일용 C2-Ultra CPU와 G2-Ultra NX GPU, 데이터센터용 Neoverse CSS N4 IP를 공개했습니다. C2-Ultra는 분기 예측과 실행 창을 개선하고 더 큰 L2 캐시와 높은 클록을 조합해 C1-Ultra 대비 최대 성능 15%, 평균 성능 12% 향상을 내세웠지만, 클록 상승을 제외하면 평균 향상은 3.2%였고 Arm이 정정한 최대 IPC 향상은 7%였습니다. G2-Ultra NX는 레지스터 접근량과 캐시 효율을 높이고 Ray Tracing 유닛과 Matrix Accelerator를 추가했지만, 행렬 가속기가 INT8과 INT16만 지원해 FP8과 BF16 활용에는 제약이 있습니다. Neoverse CSS N4는 코어 8~128개, 최대 3.8GHz, 코어당 최대 2MB L2와 다이당 최대 256MB 공유 캐시를 제공하지만, Arm의 발표 자료만으로는 핵심 마이크로아키텍처와 일부 인터페이스 구성이 확인되지 않습니다.
섹션별 상세
용어 해설
- 비순차 실행(Out-of-Order Execution)
- — 프로세서가 프로그램 명령어의 원래 순서를 그대로 기다리지 않고, 입력 데이터가 준비된 명령어부터 실행하는 방식입니다. 실행 창과 버퍼가 커지면 대기 시간을 줄이고 병렬성을 높일 수 있지만, 분기 예측과 레지스터 관리 구조가 함께 뒷받침되어야 성능 향상으로 이어집니다.
- Ray Tracing 유닛(Ray Tracing Unit)
- — 3D 장면에서 광선과 삼각형의 교차를 계산해 그림자와 반사 같은 효과를 처리하는 GPU 전용 연산 블록입니다. G2-Ultra NX는 삼각형 구조를 더 작게 만들어 중복 데이터를 줄이고 DRAM 트래픽을 13% 낮추는 방향으로 이 유닛을 개선했습니다.
- 행렬 가속기(Matrix Accelerator)
- — 행렬 곱셈과 누산을 병렬 처리해 머신러닝 연산을 빠르게 수행하는 하드웨어 블록입니다. G2-Ultra NX의 가속기는 Shader Core에 통합되어 클록당 최대 1,024 INT8 MAC 또는 512 INT16 MAC을 처리하지만 FP8과 BF16은 지원하지 않습니다.
- 칩렛(Chiplet)
- — 하나의 대형 칩을 여러 개의 작은 다이로 나누고 고속 인터커넥트로 연결하는 설계 방식입니다. Neoverse CSS N4는 멀티칩렛과 멀티소켓 구성을 지원해 단일 다이를 넘어 서버 시스템을 확장할 수 있도록 설계됐습니다.
기술
- Cortex X925
- C2-Ultra
- C2-Nano
- C2-Pro
- G2-Ultra NX
- G1-Ultra
- Neural Super Sampling
- Opacity Micromaps
- Neoverse CSS N4
- DDR5
- LPDDR6
- PCIe Gen 6/7
- CXL 4.0
- UCIe
- XRING O3
- Exynos 2600
활용 사례
- 플래그십 스마트폰 CPU
- 모바일 게임 그래픽
- 모바일 Ray Tracing
- 머신러닝 기반 업스케일링
- 데이터센터 서버 CPU
- 멀티칩렛·멀티소켓 서버
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.