본문으로 건너뛰기

HumanScale: Egocentric 인간 비디오가 Embodied Pretraining을 위한 Real-Robot 데이터보다 우수하다

데이터 확장성의 한계로 실로봇 데이터의 수집 비용과 다양성 제약이 크다. 본 연구는 5,000시간 규모에서 egocentric 데이터가 real-robot 데이터와 동등한 조건에서 더 나은 일반화를 이끌 수 있음을 실험적으로 보여준다. 특히 unseen-task에서의 일반화 이점이 두드러지며, open-world prior가 post-training 단계에서 embodiment-alignment를 적은 비용으로 보완한다.

왜 중요한가

데이터 확장성의 한계로 실로봇 데이터의 수집 비용과 다양성 제약이 크다. 본 연구는 5,000시간 규모에서 egocentric 데이터가 real-robot 데이터와 동등한 조건에서 더 나은 일반화를 이끌 수 있음을 실험적으로 보여준다. 특히 unseen-task에서의 일반화 이점이 두드러지며, open-world prior가 post-training 단계에서 embodiment-alignment를 적은 비용으로 보완한다.

핵심 기여

Egocentric pretraining이 real-robot pretraining을 능가하는 일반화 성능을 보임

동일 규모의 사전학습 데이터를 사용할 때, egocentric 데이터로 사전학습한 모델은 real-robot 데이터로 사전학습한 모델에 비해 real-robot action prediction에서 24%의 검증 손실 감소와 in-distribution/ood 실행 성공률에서 각각 52.5% 및 90% 상승을 달성한다. 이 효과는 unseen 태스크에 특히 두드러진다.

데이터 규모에 따른 egocentric pretraining의 확장성 확인

5,000시간까지 증가시킨 경우에도 seen/unseen 태스크 모두에서 손실이 감소하는 경향이 관찰되며, L = a − b ln(D) 형태의 log-linear scaling이 관찰되었다(seen R2=0.86, unseen R2=0.94).

오픈 월드 커버리지의 다양성 우위

workspace coverage, inter-session variance, interaction vocabulary, visual scene coverage 측면에서 egocentric 데이터가 real-robot 데이터에 비해 더 풍부하고 비중복적이며 다양성을 크게 확장한다.

실세계 로보틱스에의 전이 검증

AgiBot World에서의 15개 조작 태스크로 post-training 후 테스트했을 때, egocentric pretraining은 unseen 객체로의 일반화에서도 강력한 성능을 유지한다. 로봇 롤아웃에서의 성공률은 in-distribution 92.5%, out-of-distribution 90.0%로 나타났다.

실용적 제안

에고크래픽 데이터로 광범위한 세계 표현을 먼저 학습하고, 소량의 실제 로봇 데이터로 action-space 정렬을 수행하는 데이터 파이프라인을 제시한다.

핵심 아이디어 이해하기

단계1: 문제 정의 - embodied foundation models은 데이터, 모델 규모, 계산의 합성으로 성능을 끌어올리는 것이 일반적이다. 다만 embodied pretraining은 로봇 데이터를 통한 exact embodiment- alignment의 한계로 인해 수요 대비 데이터 다양성이 충분하지 않다. 또한 teleoperation 데이터는 높은 품질의 자세한 액션 정보를 제공하지만 수집 비용과 환경 다양성의 제약이 크다. 단계2: 해법의 연결고리 - egocentric video를 전면에 두고, hand-pose retargeting으로 pseudo-action 라벨을 생성하는 필터링+레이블링 파이프라인을 통해 대규모 오디오-비주얼 시퀀스의 누적 정보를 확보한다. 이를 MoT(Mixture-of-Transformers)로 구성된 World-Action Model에 입력해 미래 영상 관측과 행동을 동시에 예측하도록 학습한다. 단계3: 차별점과 효과 - 동일한 데이터 규모에서 egocentric pretraining은 unseen 태스크에서 크게 일반화 성능이 향상되며, 데이터 증가에 따른 손실 감소 및 평가 점수의 상승이 지속된다. 이는 open-world prior의 효과로 해석되며, post-training에서 실세계 로봇 데이터로 간단히 정렬해도 강건한 전달을 보인다.

방법론

Stage 1: Pretraining 데이터 구성 - Egocentric은 HumanNet에서 선별된 5,000시간으로 구성되며, per-clip end-effector poses와 gripper states는 retargeted hand-pose signals에서 추정된 pseudo-action 라벨로 제공된다. Real-robot 데이터는 여러 데이터셋에서 수집된 다중 임 embodiment trajectories로 구성된다. Stage 2: Post-training 데이터 - AgiBot World의 15개 manipulation 태스크에서 각 태스크당 100개 시연, 총 1,500 traj. Stage 3: 평가 프로토콜 - post-training의 동일한 데이터와 평가 프로토콜을 고정하고, Seen( post-training 태스크에서 보유)과 Unseen( post-training에 포함되지 않은 태스크)으로 구분해 검증한다. Stage 4: 모델 아키텍처 - 비디오 다이나믹스 예측과 액션 추론을 결합하는 MoT 아키텍처를 사용하며, 비디오 전문가를 Wan 2.2에서 초기화하고, 액션 전문가는 보간(interpolation)으로 초기화한다. Stage 5: 평가 지표 - 검증 손실(L2)과 t계열로 보정된 로짓 확률 기반의 예측 정확도 등을 사용한다. 손실은 로스 값으로 표현되며, post-training 이후 Seen/Unseen 구간에서의 성능이 보고된다.

주요 결과

메인 벤치마크: Seen 태스크에서 egocentric pretraining은 100시간 대비 5000시간에서 손실을 0.0080에서 0.0067로 감소시켜 Wan2.2 baseline 대비 35% 낮은 손실을 달성했다. Unseen 태스크에서 손실은 0.0234에서 0.0204로 감소해 Wan2.2 baseline 대비 24% 낮아졌다(실제 로봇 pretraining 대비 약 20% 수준의 개선). 로봇 pretraining 역시 증가시켰지만 Unseen에서 뚜렷한 개선을 보이지 않았다. 실세계 로봇 실험에서의 결과는 In-Distribution에서 92.5%의 성공률, Out-of-Distribution에서 90.0%의 성공률을 달성했다. Ablation 연구는 egocentric 데이터가 증가할수록 손실이 감소하는 것을 확인했고, 로드맵 상의 로그-선형 스케일(L = a − b ln(D))이 Seen(그래프 R2=0.86)과 Unseen(R2=0.94)에서 잘 맞아떨어졌다. 추가 연구로는 비디오 생성+액션 예측을 결합한 MoT 구조의 이점이 확인되었으며, real-world rollouts에서도 에고크래픽 사전학습의 우수성을 재현했다.

기술 상세

-- 아키텍처 구성: MoT(Mixture-of-Transformers) 기반으로 비디오 다이나믹스 예측과 행동 추론을 결합 -- 데이터 파이프라인: egocentric 데이터의 hand-pose retargeting으로 pseudo-action 라벨 생성, 5,000시간 규모의 pretraining, post-training 데이터 1,500 traj. -- 학습 방법: 비디오 생성+다음 상태 예측에 대한 손실과 action 예측 손실의 합으로 최적화 -- pretraining과 post-training의 분리: pretraining substrate를 다르게 두고, post-training은 동일한 로봇 데이터로 고정 -- 평가: Seen/Unseen 분할에서 action-loss(L2) 측정 및 real-world 로봇 롤아웃 평가

실무 활용

에고크래픽 데이터로 대규모 사전학습을 수행하고, 소량의 실제 로봇 데이터로 후처훈련(post-training)에서 embodiment-정렬을 보완하는 파이프라인이 실용적으로 유효하다.

  • 개발 초기 단계에서 일반화 가능한 세계 표현 학습을 빠르게 구축하고, 제한된 로봇 데이터로 효과적으로 정렬
  • 다양한 로봇 구현(다양한 임 embodiment) 간의 일반화 강화
  • 실세계 로봇 시스템에서 unseen 객체/환경에 대한 강건성 향상

코드 공개 여부: 공개

코드 저장소 보기

키워드

embodied foundation models(구현 기반 모델)egocentric video(일인칭 영상)real-robot data(실제 로봇 데이터)pretraining(사전학습)world-action model(WAM)data scaling(데이터 스케일링)diversity(다양성)environmental diversity(환경 다양성)

용어 해설

World Action Model
world dynamics와 embodied action의 공동 모형으로, 비선형 시퀀스 데이터에서 영상 관측과 행동을 함께 예측하는 아키텍처를 가리킴. Embodied pretraining에서 open-world coverage를 제공하는 핵심 개념이며 post-training으로 embodiment-alignment를 보완하는 기반을 형성한다.
egocentric 비디오(egocentric video)
일인칭 시점으로 촬영된 영상으로 손-물체 상호작용, 도구 사용, 긴 호흡의 행동 등을 포착한다. 본 연구에서 pretraining 데이터의 주요 소스이며 open-world 커버리지를 확대하는 역할을 한다.
hand-pose 재대상(hand-pose retargeting)
사람의 손 자세 신호를 로봇 엔드 이펙터 상태로 매핑하는 기법으로, egocentric 데이터에서 로봇과 같은 action-space를 구성하는 pseudo-action 라벨을 생성하는 데 사용된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 18.수집 2026. 06. 20.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.