TL;DR
언어 기반 자유형 명령을 정교한 양손 조작으로 전환하는 능력은 범용 로봇 정책의 핵심 기능이다. 본 논문은 대규모 에고센트릭 비디오로부터 로봇 제어에 적합한 행동·언어·기하학 신호를 자동으로 정제하고, 이를 실제 로봇에 효율적으로 접목시키는 전체 스택을 제시했다. 이 접근은 실세계 데이터 수집 비용을 줄이면서 언어유도 조작과 실패 복구 능력을 동시에 확보하는 실용적 경로를 제공한다.
왜 중요한가
언어 기반 자유형 명령을 정교한 양손 조작으로 전환하는 능력은 범용 로봇 정책의 핵심 기능이다. 본 논문은 대규모 에고센트릭 비디오로부터 로봇 제어에 적합한 행동·언어·기하학 신호를 자동으로 정제하고, 이를 실제 로봇에 효율적으로 접목시키는 전체 스택을 제시했다. 이 접근은 실세계 데이터 수집 비용을 줄이면서 언어유도 조작과 실패 복구 능력을 동시에 확보하는 실용적 경로를 제공한다.
핵심 기여
EgoSmith: 에고센트릭 비디오 정제 파이프라인
EgoSmith는 프리필터링, 4D 모션 복원, 다중 정교도 언어 레이블링, 후처리 필터링의 4단계로 구성되어 있다. 이 파이프라인은 DPVO와 Any4D를 결합해 카메라 외력 추정과 메트릭 스케일 깊이 정렬을 수행하고, Qwen3.5-VL-Plus로 의미 있는 조작 세그먼트를 선별한 뒤 다계층 언어 지침을 생성하여 학습 신호로 정렬했다. 파이프라인을 통해 12개 데이터셋에서 총 9.60K 시간, 2.09M 에피소드, 1.04B 프레임의 주석화된 말뭉치를 생성하고 HaWoR 대비 처리량을 9배 이상 개선했다.
통합 로봇 스택과 상대 운동 매핑을 통한 인간-중심 보정
통합 로봇 스택은 텔레오퍼레이션과 정책 추론에 동일한 FK/IK와 제어 노드를 공유하여 배포와 수집 간 실행 불일치를 줄였다. 개입 시에는 개입 시점의 로봇·인간 상태를 고정하고 이후 인간의 상대 운동을 로봇에 더하는 상대 운동 매핑을 사용하여 상태 점프 없이 매끄럽게 제어권을 넘기고 되찾는다. 이 절차로 187시간에 걸쳐 193개의 테이블탑 작업을 수집했으며 개입 성공률이 85%를 초과해 DAgger 보정 시샘플 효율을 높였다.
EgoSteer: 세계모델 전문가가 결합된 VLA 모델 설계
EgoSteer는 Qwen3-VL 백본과 DiT 기반의 액션 익스퍼트를 결합한 flow 기반 VLA 구조로, Conditional Flow Matching으로 행동 suffix의 속도장을 회귀하도록 학습했다. 학습 전용의 세계모델 전문가는 행동으로 유도되는 미래 프레임의 DINOv3 특징을 예측하도록 설계되어 백본의 행동 상상력을 강화하고 추론 시 부담을 주지 않도록 학습 단계에서만 사용된다. 실시간 청크 실행을 위해 RTC를 적용해 실행 중 공백을 제거하고, 통일된 상태·행동 표현(손목 6DoF 및 손가락 키포인트)을 통해 인간 데이터와 로봇 데이터를 일관되게 다루었다.
최적화된 대규모 학습 인프라와 처리량 확장
훈련 인프라는 HSDP를 사용해 배치 확장과 통신-계산 오버랩을 달성하고 mixed-precision과 torch.compile을 결합해 커널 융합을 적용했다. 또한 FlexAttention으로 어텐션 연산을 최적화하고 WebDataset 스트리밍으로 I/O 병목을 완화하여 8-A800 노드에서 MFU가 44.5%이고 처리량이 97 샘플/초를 달성하며 128 GPU까지 선형에 가깝게 확장했다. 이러한 인프라 최적화가 대규모 에고센트릭 사전학습과 실제 로봇 파인튜닝을 실용적 비용으로 연결했다.
광범위한 실로봇 평가와 샘플효율적 DAgger 보정
사전학습된 모델을 187시간 텔레오퍼레이션 데이터로 포스트트레이닝하고 3회 DAgger 반복으로 8.3시간의 보정 데이터를 수집하여 성능을 개선했다. 이 과정으로 40개 작업 전반에서 평균 성공률이 75%에 도달했고 DAgger 적용 전후 특정 작업의 평균 성공률이 22.5%에서 62.5%로 상승했다. 또한 9.6K시간 사전학습 기반 모델은 박스 접기와 케이크 언박싱과 같은 장시간 작업에 대해 수십에서 수백의 제한된 데모로 75% 이상 성공하는 few-shot 적응을 달성했다.
핵심 아이디어 이해하기
기존의 인간 에고센트릭 영상은 손 조작에 관한 풍부한 정보원을 제공하지만 카메라 흔들림, 가려짐, 단일 뷰 깊이 부재 등으로 인해 로봇 행동 학습 신호로 직접 사용하기 어렵다. 본 논문은 대규모의 원시 비디오를 체계적으로 정제하여 카메라 외부파라미터와 세계좌표 기반 손 궤적, 다중 수준의 자연어 지시로 정렬함으로써 인간 조작으로부터 로봇에 유용한 신호를 생성하는 것을 출발점으로 삼았다. 이 정제는 이후 모델이 물리적 상식과 언어지침을 일관되게 학습하도록 하는 전처리 관점의 핵심이다. 학습 모델 측면에서는 시각·언어 이해와 연속적 행동 생성을 동일한 표현공간에서 처리하는 것이 필요하다. EgoSteer는 대형 비전-언어 백본을 상태·이미지·지시의 컨텍스트로 사용하고, flow 기반의 액션 익스퍼트가 과거 히스토리와 예약된 행동 프리픽스를 조건으로 행동 청크의 선형 속도장을 회귀하도록 학습한다. 이러한 구성은 연속적 연산 과정에서 행동 분포를 안정적으로 모델링하고, 실시간 제어를 위한 청크 전환을 부드럽게 만드는 데 기여한다. 미래 예측 능력이 행동의 정확도를 향상시킨다는 관찰에 따라 학습 전용의 세계모델 전문가를 두어 행동이 유도할 미래 프레임의 DINOv3 특징을 예측하게 하였다. 이 모듈은 백본 표현이 행동을 상상하도록 유도해 미세 조작 정확도를 증가시키는 반면 추론 시 오버헤드는 남기지 않는다. 결과적으로 대규모 정제 데이터와 세계모델 기반의 보조 감독, 그리고 실시간 청크 실행이 결합되어 언어유도·실행 연속성·실세계 복구 능력이 동시에 개선되는 것이 핵심 직관이다.
방법론
전체 접근은 세 부분으로 분할된다. 첫째, EgoSmith 파이프라인이 원시 에고센트릭 비디오를 프리필터링으로 노이즈 세그먼트를 제거하고 DPVO 기반 카메라 추적과 Any4D 기반 깊이 예측을 결합해 메트릭 스케일의 4D 손-카메라-세계 정합을 생성한다. 둘째, 생성된 영상·궤적에 대해 Qwen3.5-VL-Plus를 이용해 5단계 계층의 언어 지침을 생성하고 에피소드·청크·프레임 수준의 후처리 필터로 품질을 보증한다. 로봇 스택 측면에서는 텔레오퍼레이션 장비로부터 얻은 인간의 SE(3) 손목 포즈와 장갑 기반 관절 상태를 동일한 FK/IK 파이프라인으로 로봇에 매핑한다. 개입(hand-over) 처리 시에는 개입 시작 시점의 로봇 상태와 인간 상태를 기록하고 이후 인간의 상대변화(ΔT, Δq)를 로봇 상태에 더하는 방식으로 상태 점프를 방지하며, 개입 구간만 DAgger 학습 데이터로 사용한다. 이 설계로 원격 제어와 자동 실행 간 실행학적 일관성을 유지했다. 모델 학습은 Qwen3-VL 백본과 DiT 기반 액션 익스퍼트의 결합으로 이루어진다. 입력은 명령문, 연속 이미지 히스토리, 현재 카메라 프레임으로 정규화된 상태 히스토리를 포함하며 출력은 카메라 프레임 기준의 상대적 행동 청크이다. Conditional Flow Matching 손실을 사용해 노이즈 섞인 suffix 벡터의 선형 속도장을 예측하도록 학습하고, training-time RTC로 prefix를 예약한 뒤 suffix를 비동기적으로 덴오이즈하여 실행 공백을 제거한다. 추가적으로 세계모델 전문가는 행동과 상대 카메라 운동을 입력으로 받아 미래 프레임의 DINOv3 특징을 회귀한다. 이 모듈은 백본 레이어에 주기적으로 어텐션을 걸어 표현을 조정하고 학습시에는 보조 손실로 작동하되 추론 단계에서는 제거되어 계산 비용을 증가시키지 않는다. 학습 인프라에서는 HSDP, mixed-precision, torch.compile, FlexAttention, WebDataset 스트리밍을 결합해 대규모 데이터 처리와 GPU 활용 효율을 확보했다.
관련 Figure

이 피규어는 파이프라인 수준에서 에고센트릭 영상 정제, 텔레오퍼레이션 기반 데이터 수집, 그리고 VLA 기반 학습과 실로봇 보정이 어떻게 연결되는지를 시각적으로 제시한다. 또한 40개 작업에서의 성공률과 few-shot 적응 결과를 인포그래픽 형태로 병기해 논문의 엔드투엔드 성과를 직관적으로 확인할 수 있다.
시스템 전반을 요약한 개요 피규어로 EgoSmith, 로봇 스택, EgoSteer의 통합 흐름과 주요 실험 결과를 한 장에 배열했다.

이미지는 프리필터링에서 광학흐름과 객체 검출을 이용해 비유용 클립을 제거하고 DPVO와 Any4D를 결합해 카메라 궤적과 깊이를 정합하는 흐름을 보여준다. 또한 Qwen3.5-VL-Plus를 이용한 다중 수준 언어 레이블링과 에피소드·청크·프레임 수준의 후처리 기준을 함께 제시해 데이터 품질 보증의 구체적 절차를 보강한다.
EgoSmith 파이프라인의 4단계(프리필터링, 4D 모션 복원, 언어 레이블링, 후처리)를 단계별로 시각화한 다이어그램이다.
주요 결과
사전학습은 3K, 6K, 9.6K시간 규모로 비교 실험을 수행했고 포스트트레이닝은 187시간 텔레오퍼레이션 데이터로 진행했다. 최종 평가에서 EgoSteer는 40개 작업 전반에서 평균 성공률 75%를 달성했고 22개 작업에서 80% 이상의 성공률을 기록하여 다수 작업에서 실용적 성능을 보였다. 특히 구성적 일반화 작업에서 평균 65% 성공률을 보였고, 전혀 보지 못한 작업에서는 평균 62%를 달성해 사전학습의 범용성이 확인되었다. DAgger 보정의 효능을 정량적으로 확인했다. 텔레오퍼레이션으로만 학습한 EgoSteer-FT의 평균 성공률은 22.5%였으나 세 번의 DAgger 반복을 통해 추가로 수집한 8.3시간의 보정 데이터를 적용한 EgoSteer-DG의 평균 성공률은 62.5%로 상승했다. 이 결과는 배포 중 발생하는 실패에 대해 표적 보정 시 적은 시간으로도 큰 성능 개선이 가능함을 의미한다. 모델 구성 요소의 중요성은 제거 실험에서 드러났다. 세계모델 목표를 제거한 변형은 미세 조작 정확도가 크게 하락했고, RTC를 제거하면 실행 중 행동 공백과 진동이 발생해 접촉 중심 작업이 실패했으며, 에고스미스의 전·후처리를 제거한 노이즈 데이터는 수렴 실패를 일으켜 명령-행동 정렬이 무너졌다. 또한 few-shot 적응 실험에서 9.6K 사전학습 모델은 박스 접기와 케이크 언박싱에서 각각 75%와 83%의 성공률을 달성했으나, DP(확산정책)과 IMLE 및 스크래치 기반 학습은 해당 작업에서 전부 실패했다.
기술 상세
전체 아키텍처는 Qwen3-VL 백본과 DiT 기반 액션 익스퍼트로 구성되며 입력은 명령 l, 카메라 내재행렬 K, 이미지 히스토리 I_{t-k+1:t}, 그리고 카메라 프레임 기준의 상태·행동 시퀀스이다. 상태 s와 행동 a는 양손의 3차원 손목 변위, 6D 회전, 그리고 15차원 손끝 키포인트를 포함하는 48차원 벡터로 통일되어 인간 데이터와 로봇 데이터 간 표현 차이를 줄였다. 행동 청크 a_{t:t+h-1}은 현재 카메라 프레임 기준으로 상대값으로 표현되어 실행 시 프레임 일관성을 보장한다. Conditional Flow Matching(CFM) 손실은 목표 suffix 행동 a_{suf}의 선형 속도장 v를 예측하도록 학습한다. 학습 과정에서 노이즈 ε∼N(0,I)와 스케일 파라미터 η∈[0,1]을 사용해 tilde{a}{suf}=(1−η)ε+η a{suf}를 생성하고, 모델 π(tilde{a}{suf},η,C_t)이 예측한 값이 (a{suf}−ε)와 L2 거리로 정합되도록 회귀한다. 입출력 흐름 관점에서 입력은 컨텍스트 C_t와 노이즈 혼합된 타깃 tilde{a}{suf}이고 연산은 속도장 회귀이며 출력은 노이즈 보정된 suffix 방향으로, 이는 샘플링 시 연속적 행동의 확률적 경로를 안정적으로 복원하는 역할을 한다. 세계모델 전문가는 행동 a{t:t+h-1}과 상대 카메라 변환 ΔT를 입력으로 받아 미래 프레임 I_{t+h-1}의 DINOv3 특징을 회귀한다. 이 모듈은 길이 L의 학습 가능 쿼리 z_{0:L-1}을 사용해 백본의 중간 레이어에 주기적 어텐션을 걸어 표현을 안내하며 네 층의 경량 Transformer로 설계되어 학습 시에만 그라디언트를 백본 방향으로 유도하고 추론 시에는 제거된다. 이러한 설계는 생성적 픽셀 예측 대신 특징 회귀를 통해 더 안정적인 감독을 제공하고 백본이 행동을 상상하도록 돕는다. Real-Time Chunking은 행동 청크의 앞부분 a_{pre}=a_{t:t+d-1}를 예약 실행하고 이후 suffix를 비동기적으로 예측해 전환한다. 학습 시에는 무작위 지연 d를 샘플링하여 모델이 suffix를 denoise하도록 훈련함으로써 실제 실행 시 예약된 prefix와 예측 suffix 사이에 갭이 생기지 않도록 보장한다. 인프라 측면에서는 HSDP를 통한 파라미터 샤딩과 통신-계산 오버랩, torch.compile과 FlexAttention을 통한 커널 수준 최적화, WebDataset 스트리밍으로 I/O 병목을 완화하여 8-A800 노드에서 MFU 44.5%와 처리량 97 샘플/초를 달성했고 128 GPU까지 거의 선형으로 확장되었다.
관련 Figure

이 이미지는 텔레오퍼레이션 입력이 어떻게 공용 제어 스택을 통해 로봇 행위로 변환되는지와 개입 시점의 상태 기록 및 상대 변화 적용 수식을 시각적으로 정리했다. 또한 세계모델 전문가, 액션 익스퍼트, RTC의 역할 분담과 개입-복구-정책 재개 시퀀스를 예시 이미지와 시간선으로 제시해 실험 재현에 필요한 운영적 세부를 보강한다.
로봇 스택과 EgoSteer 모델 아키텍처, 그리고 인간-중심 개입 시의 상대 모션 매핑 및 복구 절차를 보여주는 피규어이다.
한계점
논문에서 명시한 첫 번째 한계는 로봇의 가용 자유도(DoF) 제약으로 인해 완전한 인간의 미세 조작 기술을 그대로 전송할 수 없다는 점이다. 두 번째 한계는 데이터셋과 모델, 그리고 실험된 구현체 전반에서 촉각 피드백이 빠져 있어 접촉 중심의 복잡한 조작 성능이 제한된다는 점이다. 세 번째로는 사전학습 규모를 더 확대함으로써 더 넓은 priors를 포착하고 보지 못한 작업에 대한 일반화를 더욱 향상시킬 필요가 있다는 점이 제시되었다.
실무 활용
EgoSteer 시스템은 대규모 인간 시연으로부터 얻은 조작 priors를 실세계 로봇에 효율적으로 접목할 수 있는 실무적 워크플로를 제공한다. 텔레오퍼레이션 기반의 빠른 보정 절차와 통일된 상태·행동 표준 덕분에 실제 배포 환경에서 발생하는 실패를 적은 교정 데이터로 보정할 수 있다. 오픈소스 공개(egosteer.github.io)가 이루어져 있어 연구·실무 적용을 위한 재현 가능성이 확보되어 있다.
- 다품종 테이블탑 조작 자동화에 언어 기반 작업 지시를 도입하여 비전문 작업자가 자연어로 작업을 지시하는 시스템 구축
- 원격 전문가의 빠른 개입이 필요한 산업용 워크플로에서 인간-로봇 협업 보정 루프를 통해 현장 보정 데이터 수집 및 정책 개선
- 로봇 연구 환경에서 에고센트릭 비디오로부터 얻은 대규모 priors를 활용해 장기간 접촉·조작 과제를 few-shot으로 적응시키는 실험적 적용
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Egocentric Videos
- — 사용자의 시야에서 촬영된 비디오로, 손의 조작과 주변 물체 상호작용을 풍부하게 포함한다. 본문 맥락에서는 인간 손의 조작 궤적과 시점 정보를 로봇 조작 학습 신호로 변환하는 원천 데이터로 활용된다. 노이즈·카메라 흔들림·가려짐 문제가 있어 정제와 4D 복원이 중요하다.
- Vision-Language-Action Model
- — 입력으로 이미지와 자연어 지시를 받고, 연속적 로봇 동작을 출력하는 모델 계열이다. 본 논문에서는 Qwen3-VL 백본과 flow 기반 액션 익스퍼트를 결합해 연속적 행동 청크를 예측하도록 설계되었다. 시각 언어 이해와 연속 행동 생성 간의 정렬이 성능 핵심이다.
- Real-Time Chunking (RTC)
- — 실행 시점의 지연을 없애기 위해 행동 시퀀스의 앞부분을 예약(prefix)하고 이후 예측된 청크로 매끄럽게 전환하는 기법이다. 학습 시에는 무작위 지연을 삽입해 suffix를 노이즈 제거 방식으로 학습하여 전환 시 단절이 생기지 않게 만든다. 로봇의 연속 제어에서 실행 공백을 제거하는 데 중요하다.
- Flow Matching
- — 확률적 노이즈와 목표 행동 사이의 선형 속도장을 회귀하도록 학습하는 방법으로, 연속적 행동 분포를 모델링한다. 본문에서는 Conditional Flow Matching을 사용해 컨텍스트를 조건으로 행동 suffix의 선형 속도장을 예측하도록 학습했다. 샘플 효율과 안정성 측면에서 연속 행동 생성에 적합하다.
- DINOv3 Features
- — 이미지의 고수준 표현을 제공하는 비지도 학습 기반 특징으로, 미래 상태를 예측할 때 안정적인 감독 신호로 쓰인다. 본문에서는 행동이 유도할 미래 프레임의 DINOv3 특징을 세계모델 전문가가 회귀하도록 하여 백본의 행동 상상력을 강화했다. 생성 손실보다 안정적인 대안으로 채택되었다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
