TL;DR
NVIDIA의 Vera 기반 BlueField‑4 STX Storage Processor는 Olympus 코어, SCF 패브릭, SOCAMM2 LPDDR5X 메모리를 결합해 스토리지 전처리 연산의 CPU 처리량을 크게 끌어올린다. 메모리 상주 마이크로벤치마크에서 AES-128 암호화 최대 1.43배, Reed‑Solomon 복구 최대 3.26배, CRC32C 최대 3.67배, 압축 최대 3.29배, 다단계 압축→암호화 파이프라인 최대 3.21배의 우위를 보였다. 이러한 이득은 동시 에이전트 흐름이 많은 에이전틱 AI 환경에서 쓰기·읽기 지연을 낮추고 전력·코어 예산 내에서 더 많은 데이터 서비스를 제공할 수 있게 한다.
빠른 이해
새로운 점
동일 Vera 아키텍처로 호스트 CPU와 스토리지 처리기를 모두 가속해 에이전틱 워크로드의 CPU 측 병목을 줄이는 점.
핵심 메커니즘
높은 단일 스레드 처리 능력을 갖춘 Olympus 코어와 SCF의 고대역폭 캐시·메모리 경로 및 SOCAMM2 LPDDR5X의 코어당 메모리 대역폭이 결합되어 스토리지 원시 연산(암호화·무결성 검사·압축·복구)을 병렬 스트리밍으로 유지하면서 각 단계의 지연을 줄인다.
핵심 수치
- AES-128 암호화 처리량: up to 1.43x- Vera 대비 x86 메모리 상주 마이크로벤치마크
- Reed‑Solomon 복구 처리량: up to 3.26x- 복구 워크로드에서 Vera vs x86
- CRC32C 처리량: up to 3.67x- 무결성 검사 마이크로벤치마크
- 압축 처리량: up to 3.29x- Zstandard 기반 벤치마크에서 Vera vs x86
- 해제압축 처리량: up to 1.72x- 동시 스레드 환경에서 Vera 우위
- 다단계(압축→암호화) 파이프라인 처리량: up to 3.21x- 메모리 상주 파이프라인 전체 처리량 비교
섹션별 상세
에이전틱 AI에서 스토리지의 역할과 병목
Vera CPU 아키텍처 구성
마이크로벤치마크 설계와 비교 방식
암호화·복호화 처리 성능
- Vera는 AES-128 암호화에서 x86 대비 최대 1.43배, 복호화에서 최대 1.29배의 처리량을 낸다. — Figure 1 및 Figure 2에 기재된 메모리 상주 AES-128 벤치마크 결과
무결성 검사와 복구 연산
- Vera는 Reed‑Solomon 복구 워크로드에서 x86 대비 최대 3.26배의 처리량 우위를 보인다. — Figure 3의 Reed‑Solomon 복구 벤치마크 결과
- Vera는 CRC32C 무결성 검사에서 x86 대비 최대 3.67배의 처리량을 낸다. — Figure 4의 CRC32C 무결성 검사 벤치마크 결과
압축·해제압축 처리와 동시성 특성
- Vera는 압축 처리에서 최대 3.29배, 해제압축에서 최대 1.72배의 처리량 우위를 유지한다. — Figure 5와 Figure 6의 압축·해제압축 벤치마크 결과
다단계 쓰기 파이프라인과 시스템 영향
- 압축 후 암호화를 연속 실행하는 다단계 파이프라인에서 Vera는 최대 3.21배의 총 처리량을 달성한다. — Figure 7의 메모리 상주 압축→암호화 파이프라인 측정
에이전트 실행과 스토리지 처리의 통합적 확장성
용어 해설
- 리드-솔로몬 부호(Reed‑Solomon)
- — 리드-솔로몬 부호는 블록 단위의 데이터 손실을 보완하는 erasure coding 기법으로, 원본 데이터 조각과 추가한 패리티 조각을 조합해 손상 또는 손실된 블록을 복구한다. 저장장치 장애 시 재구성(recovery) 비용과 대역폭 요구가 중요한 환경에서 복구 성능이 시스템 복구 시간과 서비스 연속성에 직접적인 영향을 미친다.
- CRC32C 체크섬(CRC32C)
- — CRC32C는 저장 및 전송 중 발생한 우연한 데이터 손상을 검출하는 32비트 순환 중복 검사 방식으로, 읽기·쓰기 경로에서 빠른 무결성 검증을 위해 널리 사용된다. 대용량 데이터 흐름에서는 CRC 계산 처리량이 전체 응답성과 스토리지 대역폭 사용률에 영향을 준다.
- SOCAMM2 LPDDR5X 메모리(SOCAMM2 LPDDR5X)
- — SOCAMM2는 교체 가능한 LPDDR5X 기반 메모리 모듈 규격으로, 데이터센터에서 낮은 전력으로 높은 대역폭을 제공하면서 서비스 가능성과 신뢰성을 유지하도록 설계되었다. 높은 집적 I/O 워크로드에서 코어당 메모리 대역폭을 확보해 스레드 간 간섭을 줄이는 역할을 한다.
- Scalable Coherency Fabric(Scalable Coherency Fabric (SCF))
- — SCF는 다수의 코어, 공유 캐시, 메모리 컨트롤러, I/O를 단일 칩 내에서 일관된 캐시·메모리 접근 경로로 연결하는 고대역폭 코히어런시 패브릭이다. 높은 bisection 대역폭(문서상 최대 3.4 TB/s)과 통합 L3 캐시(164 MB)를 통해 대규모 동시 스트리밍 워크로드에서 예측 가능한 데이터 접근성을 유지한다.
- Spatial Multithreading
- — Spatial Multithreading은 하나의 물리적 칩에서 다수의 스레드를 동시 실행해 처리량을 높이는 기법으로, Vera에서는 88코어에 대해 176스레드를 지원해 제어 중심 코드와 데이터 중심 코드가 섞인 스토리지 연산에서 코어 활용률을 끌어올린다. 스레드 간 간섭을 줄이는 아키텍처 특성이 고동시성 환경에서 중요하다.
기술
- AES-128
- Reed-Solomon
- CRC32C
- OpenSSL
- Zstandard
- LZ4
- SOCAMM2 LPDDR5X
- Scalable Coherency Fabric (SCF)
- Olympus CPU cores
- BlueField-4 STX
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.