본문으로 건너뛰기

Xiaomi, 120B 로컬 AI 컴퓨터 AI Cube 공개

Xiaomi가 120B 모델을 로컬 실행하는 AI Cube 프로토타입을 공개했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Xiaomi가 세 개의 자체 XRING 프로세서와 최대 160GB 통합 메모리를 결합한 AI Cube 프로토타입을 공개하며 대규모 로컬 추론 하드웨어 시장에 진입했습니다. XRING O3, XRING D100, XRING O100이 시스템 제어와 메모리 구성, 주 연산을 나눠 맡고, 본문은 1.2TB/s와 1.22 TB/s의 메모리 대역폭 및 약 150W의 지속 전력을 제시합니다. 이 장치는 120B 언어 모델과 3B 엣지 모델을 동시에 오프라인에서 실행하고 Xiaomi의 Human x Car x Home 생태계를 현장에서 연결하는 용도로 구상됐습니다. 다만 현재는 엔지니어링 프로토타입이며 실제 제품의 가격과 독립적인 성능 검증 결과는 공개되지 않았습니다.

섹션별 상세

01
Xiaomi가 세 개의 자체 제작 XRING 프로세서를 결합한 소형 로컬 AI 컴퓨터 Xiaomi AI Cube 프로토타입을 공개했습니다. 이 장치는 클라우드 서버로 사용자 데이터를 전송하지 않고 대규모 언어 모델을 현장에서 실행하도록 설계됐습니다. 기사에 따르면 Xiaomi는 이를 통해 Apple의 Mac Studio와 Mac mini, 온디바이스 Apple Intelligence 생태계에 도전하려 합니다.
02
AI Cube의 연산 구조는 역할이 나뉜 세 칩의 협력에 기반합니다. XRING O3는 운영체제 명령과 애플리케이션 로직, 가벼운 모델 작업을 처리하고, 자동차용 신경망 프로세서인 XRING D100은 대규모 통합 메모리 구성을 지원하며, XRING O100은 3D 웨이퍼 수준 메모리 적층과 수만 개의 병렬 데이터 연결로 주 연산을 맡습니다. 이 구조는 프로세서와 메모리 사이의 데이터 이동 병목을 줄여 대형 모델을 작은 데스크톱 폼팩터에서 구동하려는 접근입니다.
03
로컬 대규모 모델 실행에서 가장 큰 제약은 메모리 용량과 메모리 대역폭입니다. Xiaomi AI Cube는 본문에서 메모리 대역폭을 1.2TB/s와 1.22 TB/s로 각각 표기했으며, 최대 160GB 통합 메모리와 200 TOPS NPU, 150W 지속 전력도 함께 제시됐습니다. 기사와 인용된 게시물은 이 구성을 이용해 120B 언어 모델과 3B 엣지 모델을 동시에 낮은 지연으로 실행할 수 있다고 전합니다.
04
AI Cube는 단순한 개인용 컴퓨터보다 Xiaomi의 Human x Car x Home 구상을 위한 로컬 허브에 가깝습니다. 스마트홈 기기, 스마트 안경, 전기차를 외부 클라우드 대신 현장 장치에서 연결하고 처리하는 방식이기 때문입니다. 개발자와 창작자, 개인정보 보호를 중시하는 기업에는 120B 모델을 실행하는 전용 장비가 고가의 통합 메모리 Mac Studio를 대체할 가능성이 있지만, 현재 제품은 양산 전 엔지니어링 프로토타입이라는 한계가 있습니다.
05
Xiaomi는 XRING 프로세서 제품군을 2027년까지 모바일 플래그십, 태블릿, 스마트 전기차에 단계적으로 상용화할 계획이라고 밝혔습니다. 따라서 AI Cube의 의미는 단일 데스크톱 제품보다 자체 실리콘과 로컬 추론 생태계를 함께 확장하려는 하드웨어 전략에 있습니다. 다만 기사에 제시된 성능 수치는 프로토타입과 관련 게시물의 주장에 기반하므로 실제 양산 제품의 가격, 소프트웨어 호환성, 독립적인 벤치마크 결과는 아직 확인되지 않았습니다.

용어 해설

로컬 추론(Local Inference)
클라우드 서버로 데이터를 보내지 않고 사용자 기기에서 AI 모델의 입력 처리와 결과 생성을 수행하는 방식입니다. Xiaomi AI Cube는 대규모 언어 모델의 가중치와 연산을 로컬 하드웨어에 배치해 외부 서버 의존성과 데이터 전송을 줄이는 구조를 채택했습니다. 개인정보 보호와 지속적인 구독 비용 절감이 주요 의미입니다.
통합 메모리(Unified Memory)
CPU와 AI 가속기 같은 여러 연산 장치가 하나의 메모리 공간을 함께 사용하는 구조입니다. 모델 가중치를 장치 사이에서 반복적으로 복사하지 않아 대규모 모델 실행에 필요한 데이터 이동을 줄일 수 있습니다. 기사에서는 160GB 통합 메모리와 1.22 TB/s급 대역폭이 로컬 120B 모델 실행의 핵심 조건으로 제시됩니다.
메모리 대역폭(Memory Bandwidth)
프로세서와 메모리 사이에서 일정 시간 동안 이동할 수 있는 데이터의 양입니다. 대규모 언어 모델은 가중치를 반복적으로 읽어야 하므로 메모리 용량뿐 아니라 데이터 공급 속도도 추론 지연에 직접 영향을 줍니다. Xiaomi AI Cube는 본문에서 1.2TB/s와 1.22 TB/s로 표기된 높은 대역폭을 통해 이 병목을 줄이려 합니다.
온프레미스 AI(On-Premise AI)
AI 모델과 연산 장비를 외부 클라우드가 아닌 조직이나 사용자의 현장에 설치해 운영하는 방식입니다. Xiaomi AI Cube는 민감한 데이터를 외부 서버로 보내지 않고 스마트홈 기기, 스마트 안경, 전기차와 연결된 로컬 허브로 활용하는 구상을 전제로 합니다. 데이터 통제와 네트워크 비의존성이 주요 이점으로 제시됩니다.

기술

  • Xiaomi AI Cube
  • XRING O3
  • XRING D100
  • XRING O100
  • 3D wafer-level memory stacking
  • NPU
  • Apple Intelligence
  • Private Cloud Compute

활용 사례

  • 120B 대규모 언어 모델의 오프라인 실행
  • 3B 엣지 모델과 대규모 모델의 동시 실행
  • 스마트홈·스마트 안경·전기차를 연결하는 로컬 AI 허브
  • 개발자와 창작자를 위한 전용 로컬 추론 장비
  • 기업의 민감한 데이터 처리를 위한 온프레미스 AI
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 25.수집 2026. 08. 25.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.