본문으로 건너뛰기

Xiaomi-Robotics-U0: 재학습된 월드 파운데이션 모델을 이용한 통합 임베디드 합성 모델이며, 이 모델은 멀티뷰 장면 생성·전이·비디오 예측을 하나의 자기회귀 프레임워크로 통합해 로봇 친화적 생성 능력을 확보했다. 논문은 380억 매개변수 멀티모달 모델 구조, 데이터 파이프라인, FlashAR+ 병렬 디코딩 확장, 그리고 실제 로봇 태스크에서의 증강 효과를 체계적으로 보고했다.

Xiaomi-Robotics-U0는 38B 자기회귀 멀티모달 모델로 멀티뷰 일관성과 로봇 동역학을 유지하면서 장면 생성·전이·비디오 생성을 통합하여 로봇 학습용 합성 데이터 엔진을 제공한다.

용어 해설

다중 뷰 일관성(Multi-view Consistency)
다중 카메라 관측에서 서로 다른 관점의 이미지들이 동일한 3차원 장면 구조와 객체 배치를 유지하는 성질로서, 임베디드 합성에서는 깊이·표면 위치·객체 정체성이 뷰 간에 일관되게 보존되어야 실제 로봇 제어와 호환된다.
대각선(안티대각선) 병렬 디코딩(Anti-diagonal Decoding)
이미지 토큰 그리드의 r+c 값으로 그룹을 정의하고 동일 그룹 내 토큰은 병렬로 샘플링하며 이전 그룹만 참조하도록 하는 디코딩 스케줄로서, 직렬 토큰 수를 줄여 고해상도 이미지 생성의 추론 지연을 크게 낮춘다.
IBQ 토크나이저(IBQ Tokenizer)
이미지 패치를 16×16 공간 압축비로 벡터화한 코드북 기반 토크나이저로서 이미지 픽셀을 이산 토큰으로 변환하여 텍스트와 통일된 어휘로 자기회귀 모델이 처리할 수 있게 만든다.
구조화된 제어 변수 분해(Structured Control)
워크스페이스, 배경, 불필요 객체, 타깃 객체, 조명 등 장면 속성들을 독립적인 제어 차원으로 분해하여 각 차원을 별도 조건으로 제공함으로써 세밀한 장면 전이와 합성 제어를 가능하게 하는 설계 방식이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 13.수집 2026. 07. 15.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.