본문으로 건너뛰기
HF Daily Papers조회 2

Xiaomi-Robotics-1: 100,000시간 이상의 실제 궤적로 확장한 시각-언어-행동 기반 로봇 파운데이션 모델

100,000시간 이상의 UMI 실세계 궤적과 자동 언어 주석으로 사전학습한 Xiaomi-Robotics-1이 대규모 스케일링으로 실환경 지시 수행과 적은 데이터로의 효율적 미세조정 능력을 확보했다.

용어 해설

시각-언어-행동 모델(Vision-Language-Action (VLA))
시각적 관찰과 자연어 지시를 입력으로 받아 로봇의 연속된 행동 궤적을 출력하는 통합 모델 계열이다. 본 논문에서는 대규모 실제 조작 궤적과 언어화된 상태전이(conditioning)를 결합해 행동생성을 학습하는 주된 프레임워크로 사용되며, 일반화된 행동 생성 능력을 얻기 위해 사전학습과 교체적 정렬(post-training)을 적용했다.
플로우 매칭(Flow Matching)
확산 기반 연속 행동 생성에서 모델이 예측하는 벡터 필드 v_theta를 목표 장(u)과 L2 손실로 일치시키는 학습법이다. 노이즈 혼합 샘플 a~와 시간 τ를 입력으로 받아 벡터 차이를 최소화함으로써 역확산(recovery) 과정에서 깨끗한 행동을 복원하도록 학습한다.
확산 변환기(Diffusion Transformer (DiT))
Transformer 구조를 기반으로 flow-matching 손실을 통해 연속적 행동 청크를 생성하는 모듈이다. 본 논문에서는 VLM의 KV 캐시를 조건으로 받아 행동 벡터 필드를 예측하고, 5-스텝 Euler 통합으로 노이즈 초기값에서 행동을 복원한다.
UMI 장치(UMI devices)
휴대형 핸드헬드 조작기구와 시야가 결합된 데이터 수집 장치로서, 실제 환경에서 대규모 조작 궤적을 저비용으로 수집하게 해준다. 논문에서는 100,000시간 이상의 전처리 데이터 원천으로 사용되어 다양성과 규모 확보에 기여했다.
Choice Policies
VLM 내부에서 K개의 후보 행동 청크와 각 후보의 점수를 예측한 뒤, 가장 행동 손실이 작은 후보를 선택하여 회귀 손실에 포함시키는 보조 감독 기법이다. 이 기법은 VLM의 표현을 행동생성에 적합하도록 유도하여 DiT 학습 수렴을 가속하는 역할을 한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 16.수집 2026. 07. 21.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.