본문으로 건너뛰기

MLPerf Inference v6.0 벤치마크에서 Intel Xeon 6 및 Arc Pro B-시리즈 GPU의 강력한 AI 추론 성능 입증

Intel은 MLPerf v6.0 벤치마크를 통해 Xeon 6와 Arc Pro B70 GPU가 워크스테이션 및 엣지 환경에서 뛰어난 AI 추론 성능과 가성비를 제공함을 입증했다.

섹션별 상세

01
Intel Arc Pro B70은 MLPerf v6.0 벤치마크에서 이전 세대인 B60 대비 최대 1.8배의 성능 향상을 기록했다. 하드웨어 아키텍처의 진화와 더불어 최적화된 소프트웨어 스택이 결합되어 전문 그래픽 작업과 AI 개발자에게 높은 가치를 제공한다. 이러한 성능 향상은 고성능 워크스테이션 환경에서 복잡한 AI 워크로드를 더 빠르게 처리할 수 있게 한다.
Intel Arc Pro B70 그래픽 카드의 외형 렌더링 이미지이다.
Photo벤치마크의 핵심 하드웨어인 Arc Pro B70의 실물 디자인을 보여준다. 싱글 슬롯 형태의 블로워 팬 디자인을 채택하여 워크스테이션 및 서버 환경에서의 멀티 GPU 구성을 용이하게 함을 시사한다.
02
4개의 Intel Arc Pro B70/B65 GPU를 장착한 시스템은 총 128GB의 VRAM을 제공하여 1,200억(120B) 개의 파라미터를 가진 대규모 언어 모델을 원활하게 구동한다. 높은 메모리 용량 덕분에 대규모 모델에서도 높은 동시성을 유지하며 추론 작업을 수행할 수 있는 환경이 마련됐다. 이는 데이터 프라이버시를 유지하면서도 고성능 AI 모델을 로컬 환경에서 운영하려는 기업에게 적합한 솔루션이다.
03
동일한 하드웨어인 Intel Arc Pro B60에서도 소프트웨어 최적화만으로 MLPerf v5.1 대비 최대 1.18배의 성능 향상을 이끌어냈다. Intel은 컨테이너화된 오픈 소프트웨어 스택을 통해 하드웨어의 잠재력을 최대한 끌어올리는 전략을 취하고 있다. 이는 사용자가 하드웨어 교체 없이도 최신 소프트웨어 업데이트만으로 실질적인 성능 이득을 얻을 수 있음을 의미한다.
04
Intel Xeon 6 프로세서는 MLPerf 6.0 제출물의 절반 이상에서 호스트 CPU로 사용되며 AI 인프라의 핵심 역할을 수행하고 있다. P-코어를 탑재한 Xeon 6는 이전 세대 대비 최대 1.9배의 성능 향상을 보였으며, AMX 및 AVX512 기술을 통해 별도 가속기 없이도 LLM 추론을 지원한다. 이는 서버 인프라의 총 소유 비용(TCO)을 절감하면서도 강력한 AI 성능을 확보할 수 있는 기반이 된다.
Intel Xeon 6 프로세서의 실제 모습이다.
PhotoAI 추론 인프라의 핵심 호스트 CPU인 Xeon 6의 외형을 보여준다. 내장된 AMX 가속 기술을 통해 별도 가속기 없이도 강력한 AI 성능을 제공하는 주체임을 강조한다.
05
멀티 GPU 설정에서 Intel Arc Pro B70은 경쟁사 솔루션 대비 최대 1.6배 더 큰 KV 캐시 용량을 확보할 수 있다. KV 캐시 용량의 증가는 더 긴 컨텍스트 윈도우를 처리하거나 더 큰 모델을 실행할 때 시스템의 병목 현상을 줄이는 핵심 요소이다. 이를 통해 복잡한 RAG 시스템이나 긴 대화 맥락이 필요한 AI 서비스에서 더 높은 처리량을 기대할 수 있다.

이미지 분석

Intel의 Dan Rodriguez가 임베디드 월드 2026에서 프로세서를 들고 있는 모습이다.
Photo

엣지 및 임베디드 환경을 위한 Intel의 하드웨어 리더십을 상징적으로 보여준다. 기사에서 언급된 엣지 시스템용 AI 추론 솔루션의 실제 적용 가능성을 시각화한다.

Intel의 Dan Rodriguez가 임베디드 월드 2026에서 프로세서를 들고 있는 모습이다.

용어 해설

MLPerf
MLCommons에서 주관하는 AI 성능 측정 표준 벤치마크이다. 하드웨어, 소프트웨어, 서비스의 추론 및 학습 성능을 공정하게 비교하기 위해 다양한 실제 AI 워크로드를 시뮬레이션하며 업계 표준 지표로 활용된다.
추론(Inference)
학습된 AI 모델을 실제 데이터에 적용하여 예측이나 결과를 도출하는 과정이다. 실시간 서비스 응답 속도와 시스템 처리량을 결정짓는 핵심 단계로, 낮은 지연 시간과 높은 효율성이 요구된다.
비디오 램(VRAM)
GPU 전용 메모리로, AI 모델의 파라미터와 연산 데이터를 저장하는 공간이다. VRAM 용량이 클수록 더 큰 규모의 모델을 로드하거나 더 많은 데이터를 동시에 처리할 수 있어 AI 성능에 직접적인 영향을 미친다.
AMX (고급 행렬 확장)(AMX (Advanced Matrix Extensions))
Intel CPU에 내장된 하드웨어 가속 기술로, 딥러닝의 핵심인 행렬 연산을 비약적으로 빠르게 처리한다. 별도의 GPU 없이도 CPU만으로 효율적인 AI 추론과 파인튜닝을 가능하게 하여 인프라 비용을 절감한다.
KV 캐시(KV Cache)
LLM 추론 시 이전 토큰의 Key와 Value 값을 메모리에 저장하여 재계산을 방지하는 기술이다. 캐시 용량이 클수록 더 긴 문맥을 한 번에 처리할 수 있으며, 전체적인 추론 속도와 효율성을 높이는 데 필수적이다.

기술

  • Intel Xeon 6
  • Intel Arc Pro B70
  • Intel Arc Pro B65
  • AMX
  • AVX512
  • MLPerf v6.0

활용 사례

  • 워크스테이션 기반 LLM 추론
  • 엣지 컴퓨팅 AI 워크로드
  • 엔터프라이즈 AI 인프라 최적화
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 02.수집 2026. 04. 02.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.