TL;DR
Xiaomi가 세 개의 자체 XRING 프로세서와 최대 160GB 통합 메모리를 결합한 AI Cube 프로토타입을 공개하며 대규모 로컬 추론 하드웨어 시장에 진입했습니다. XRING O3, XRING D100, XRING O100이 시스템 제어와 메모리 구성, 주 연산을 나눠 맡고, 본문은 1.2TB/s와 1.22 TB/s의 메모리 대역폭 및 약 150W의 지속 전력을 제시합니다. 이 장치는 120B 언어 모델과 3B 엣지 모델을 동시에 오프라인에서 실행하고 Xiaomi의 Human x Car x Home 생태계를 현장에서 연결하는 용도로 구상됐습니다. 다만 현재는 엔지니어링 프로토타입이며 실제 제품의 가격과 독립적인 성능 검증 결과는 공개되지 않았습니다.
섹션별 상세
용어 해설
- 로컬 추론(Local Inference)
- — 클라우드 서버로 데이터를 보내지 않고 사용자 기기에서 AI 모델의 입력 처리와 결과 생성을 수행하는 방식입니다. Xiaomi AI Cube는 대규모 언어 모델의 가중치와 연산을 로컬 하드웨어에 배치해 외부 서버 의존성과 데이터 전송을 줄이는 구조를 채택했습니다. 개인정보 보호와 지속적인 구독 비용 절감이 주요 의미입니다.
- 통합 메모리(Unified Memory)
- — CPU와 AI 가속기 같은 여러 연산 장치가 하나의 메모리 공간을 함께 사용하는 구조입니다. 모델 가중치를 장치 사이에서 반복적으로 복사하지 않아 대규모 모델 실행에 필요한 데이터 이동을 줄일 수 있습니다. 기사에서는 160GB 통합 메모리와 1.22 TB/s급 대역폭이 로컬 120B 모델 실행의 핵심 조건으로 제시됩니다.
- 메모리 대역폭(Memory Bandwidth)
- — 프로세서와 메모리 사이에서 일정 시간 동안 이동할 수 있는 데이터의 양입니다. 대규모 언어 모델은 가중치를 반복적으로 읽어야 하므로 메모리 용량뿐 아니라 데이터 공급 속도도 추론 지연에 직접 영향을 줍니다. Xiaomi AI Cube는 본문에서 1.2TB/s와 1.22 TB/s로 표기된 높은 대역폭을 통해 이 병목을 줄이려 합니다.
- 온프레미스 AI(On-Premise AI)
- — AI 모델과 연산 장비를 외부 클라우드가 아닌 조직이나 사용자의 현장에 설치해 운영하는 방식입니다. Xiaomi AI Cube는 민감한 데이터를 외부 서버로 보내지 않고 스마트홈 기기, 스마트 안경, 전기차와 연결된 로컬 허브로 활용하는 구상을 전제로 합니다. 데이터 통제와 네트워크 비의존성이 주요 이점으로 제시됩니다.
기술
- Xiaomi AI Cube
- XRING O3
- XRING D100
- XRING O100
- 3D wafer-level memory stacking
- NPU
- Apple Intelligence
- Private Cloud Compute
활용 사례
- 120B 대규모 언어 모델의 오프라인 실행
- 3B 엣지 모델과 대규모 모델의 동시 실행
- 스마트홈·스마트 안경·전기차를 연결하는 로컬 AI 허브
- 개발자와 창작자를 위한 전용 로컬 추론 장비
- 기업의 민감한 데이터 처리를 위한 온프레미스 AI
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.