TL;DR
로봇 조작 데이터는 관측·동작 표준이 다양하고 수집 비용이 높아 대규모 학습을 통한 일반화가 어렵다. 이 논문은 표현·동작·행동 차원의 정렬을 통해 서로 다른 로봇·인간 비디오·합성 데이터를 일관된 템플릿으로 통합하고, 대규모 코퍼스(약 38,100시간)를 학습해 실세계 및 OOD 조건에서 제로-숏 지시 수행과 교체체 전이를 달성했다. 따라서 로봇용 파운데이션 모델의 확장 가능성과 전이성 문제에 직접적인 해결책을 제시한다.
왜 중요한가
로봇 조작 데이터는 관측·동작 표준이 다양하고 수집 비용이 높아 대규모 학습을 통한 일반화가 어렵다. 이 논문은 표현·동작·행동 차원의 정렬을 통해 서로 다른 로봇·인간 비디오·합성 데이터를 일관된 템플릿으로 통합하고, 대규모 코퍼스(약 38,100시간)를 학습해 실세계 및 OOD 조건에서 제로-숏 지시 수행과 교체체 전이를 달성했다. 따라서 로봇용 파운데이션 모델의 확장 가능성과 전이성 문제에 직접적인 해결책을 제시한다.
핵심 기여
교체체 전용 통합 정렬 프레임워크
상태와 동작을 80차원 표준 벡터로 통일하고 각 차원별 바이너리 마스크로 결손 슬롯을 무시해 다양한 로봇 형태를 하나의 템플릿으로 통합했다. EEF 동작은 카메라-프레임 델타 포즈로 표현해 시각적으로 유사한 동작을 수치적으로 근접시키고, 인-컨텍스트 정책 적응은 에피소드 내부 실행 이력을 임베딩해 암묵적인 기구 식별자 역할을 수행하도록 설계했다. 이들 기법은 이질적 데이터가 상호 간섭이 아니라 시너지로 작동하도록 만들었다.
대규모다중원천 조작 데이터 코퍼스 구축
공개 로봇 데이터와 에고센트릭 인간 비디오를 통합해 약 38,100시간의 사전학습용 조작 데이터를 구성했다. 인간-대-로봇 합성(H2R) 파이프라인은 약 1,933시간의 에고 비디오를 15개 로봇 형태로 렌더링해 약 24,808시간의 합성 궤적을 생성했고, SAM3 분할·ProPainter 인페인팅·MuJoCo IK 기반 베이스 탐색과 깊이 기반 합성을 적용해 시각·동작 정합을 확보했다. 다단계 큐레이션으로 신호 품질을 보장했다.
VLM 유지와 동작 학습을 병렬로 보존하는 이중 스트림 공동학습
시각·언어 백본(Qwen3.5-4B)과 DiT 기반 액션 전문가를 결합하고 VLA 데이터와 대규모 VL 데이터를 9:1 비율로 공동 학습해 VLM이 행동 예측 손실로 인해 망가지지 않도록 제어했다. LVLM의 가중치를 λ=0.1로 설정하고 flow-matching 기반 LFM과 결합해 행동 생성과 시각·언어 추론 능력을 동시에 유지했다.
실세계 및 OOD 중심 평가 기준과 실제 로봇 검증
LIBERO-Plus, RoboTwin-Clean2Rand, RoboCasa365, EBench에 더해 RoboTwin-IF(지시-따름 진단) 및 RoboTwin-XE(영 제로-숏 교체체 전이) 등을 OOD 지표로 채택했다. QWEN-ROBOTMANIP은 주요 OOD 벤치마크에서 기존 모델 대비 유의미한 격차를 보였고, AgileX ALOHA, Franka, UR, ARX 실로봇에서 실제 배포성과 적응성을 입증했다.
핵심 아이디어 이해하기
로봇 조작 학습의 핵심 장벽은 데이터의 이질성이다. 서로 다른 연구실과 플랫폼에서 기록된 상태·동작·카메라 기준이 일관되지 않으면 단순히 데이터량을 늘려도 모델이 각 관례를 통합하지 못하고 간섭이 발생한다. 따라서 먼저 다른 소스의 신호를 동일한 수치적 공간으로 정렬해야만 확장성이 실효를 발휘한다. 정렬은 세 축에서 수행된다. 표현 정렬은 모든 로봇을 80차원 표준 상태·동작 템플릿으로 매핑하고, 사용 가능한 슬롯에만 손실을 흐르게 하는 바이너리 마스크를 적용해 구조적 결손을 처리한다. 동작 정렬은 엔드이펙터 동작을 카메라-프레임 델타로 표현해 시각적 유사도를 수치적 근접성으로 전환한다. 행동 정렬은 인-컨텍스트 실행 이력을 에피소드 수준의 암묵적 기구 식별자로 활용해 런타임에 동작 스타일을 조정하게 한다. 이 정렬 설계는 VLM 백본의 시각·언어 능력을 보존하면서 대규모 이질적 조작 데이터를 통합 학습할 수 있게 만든다. VLM과 액션 전문가를 분리해 각각의 역할을 유지하고, 공동학습을 통해 시각·언어 표현이 행동 생성에 안정적으로 연결되도록 한다. 결과적으로 정렬된 표현은 데이터 규모 증대가 곧 성능 개선으로 귀결되는 스케일링 법칙을 복원했다.
방법론
전체 아키텍처는 Qwen3.5-4B 기반의 vision-language backbone과 flow-matching 목표로 학습되는 Diffusion Transformer(DiT) 액션 전문가로 분리됐다. 백본은 다중 카메라 프레임과 언어 지시를 한 번에 인코딩해 마지막 레이어의 히든 스테이트(Dvlm=2560)를 생성하고, DiT는 N=10 블록, Dact=768 구조로 상태·잡음 섞인 행동 토큰을 자기-어텐션으로 처리한 뒤 교차-어텐션으로 VLM의 히든을 참조해 속도장 예측을 수행한다. 교차-어텐션은 시각 토큰과 언어 토큰을 번갈아 참조하도록 구성돼 각 처리 단계에서 시공간 및 지시 정보를 연동한다. 행동 표현은 80차원 표준 벡터로 구성되며 각 팔 슬롯은 관절(7), EEF 포즈(3+6=9), 그리퍼(1), 다관절 손(12) 등 의미 그룹으로 배치된다. EEF 상태는 6D 연속 회전 표현을 사용하고, EEF 행동은 카메라-프레임 델타로 표현하되 행동에서의 회전 델타는 3D 회전 벡터로 파라미터화한다. 카메라 기하학은 Camera Positional Encoding(CaPE)을 통해 DiT의 키·쿼리·값에 주입해 시각 토큰과 상태/행동 토큰 간의 기하학적 관계를 점곱 어텐션 수준에서 인코딩한다. 데이터 측면에서는 로봇 원데이터, 에고센트릭 인간 비디오, 그리고 인간-대-로봇 합성(H2R)을 결합했다. H2R 파이프라인은 MANO 기반 손 키포인트로 EEF 위치를 계산하고 Savitzky–Golay 필터와 SLERP로 궤적을 평활화한 뒤 SAM3로 팔-손 영역을 마스킹하고 ProPainter로 인페인팅해 배경을 복원한다. 베이스 포즈 최적화는 궤적의 공간 극점을 커버하는 키프레임 집합에 대해 각 로봇별 도달 반경을 고려한 그리드 탐색을 수행하고 MuJoCo IK로 관절 궤적을 얻어 렌더링 및 깊이 합성으로 최종 합성 영상을 생성했다. 학습 목적함수는 flow-matching LFM과 VLM의 언어 다음-토큰 예측 LVLM의 합으로 구성된다. LFM은 a와 가우시안 노이즈 ϵ을 혼합한 xt=(1−t)ϵ+t a를 만들고 모델이 a−ϵ를 예측하도록 MSE를 최소화하며, t는 Beta(1,1.5)에서 샘플링한다. 에포크 내에서 각 샘플은 per-dimension/per-step 유효성 마스크로 가려져 결손 차원은 손실에서 제외된다. VLM 손실의 상대 가중치는 λ=0.1으로 설정됐다. 학습은 VLA 데이터와 대규모 VL 데이터를 9:1 비율로 동시 공급하는 dual-stream co-training으로 수행됐다.
주요 결과
학습 코퍼스는 공개 로봇 데이터와 에고 비디오를 통합해 약 38,100시간으로 집계됐다. 이 중 인간-대-로봇 합성으로 생성된 합성 시연은 약 24,808시간이다. QWEN-ROBOTMANIP은 표준 내부 분포 벤치마크에서는 최고권 수준의 성능을 보였고(LIBERO 99.1% 등), OOD 중심 평가에서 뚜렷한 우위를 나타냈다. 예컨대 LIBERO-Plus에서 QWEN-ROBOTMANIP-Context는 91.4%로 π0.5의 84.4%를 상회했고, RoboTwin-Clean2Rand Hard에서는 69.4%로 π0.5의 47.9%보다 크게 앞섰다. 지시-따름 능력을 측정하는 RoboTwin-IF에서 QWEN-ROBOTMANIP은 72.2%를 기록해 π0.5의 49.6%보다 22.6포인트 높은 성능을 보였다. 교체체 제로-숏 전이 평가인 RoboTwin-XE에서는 카메라-프레임 EEF 표현으로 평균 23.9%를 달성해 π0.5의 7.5%를 크게 상회했다. 실로봇 검증에서는 CobotMagic ALOHA 상의 ID 평균 성공률 88.6%와 OOD 평균 87.5%를 달성해 기존 공개 기법 대비 실배포성에서도 우수함을 보였다. 표준화된 챌린지 RoboChallenge Table30 v1 일반화 트랙에서는 단일 정책으로 1위(성공률 45%/공정 점수 59.83)를 기록해 비교군 대비 상대적으로 높은 개선폭을 보였다. 추가적인 성능 분석에서 카메라-프레임 EEF 정렬과 통합 상태-동작 표현이 데이터 스케일링의 조건임이 나타났다. 정렬이 누락된 변형은 데이터량 증가에도 검증 MSE 및 하위 과제 성능이 불안정했으나, UnifiedEEF를 적용한 변형은 데이터 비율 1%→100% 구간에서 검증 MSE가 대체로 로그-선형으로 개선되며 downstream OOD 성능이 일관되게 상승했다.
기술 상세
전체 시스템은 Qwen3.5-4B 기반의 VLM과 DiT 액션 헤드를 결합하는 구조다. VLM은 Vision Transformer에서 생성된 비주얼 토큰을 텍스트 토큰 스트림과 조합해 단일 Transformer로 처리하며, 마지막 레이어의 히든(Dvlm=2560)을 DiT가 교차-어텐션으로 소비한다. DiT 블록 내부는 자기-어텐션→교차-어텐션→SwiGLU FFN 순으로 구성되며 시각과 언어 토큰에 대한 교차참조는 블록 인덱스에 따라 번갈아 적용된다. 액션 전문가의 입력은 상태 인코더(2-layer MLP)로부터 얻은 상태 토큰과 노이즈가 섞인 행동 토큰의 직렬화다. 흐름-매칭 목표는 xt=(1−t)ϵ+t a를 구성하고 모델이 a−ϵ를 예측하도록 MSE를 최소화하는데, t는 Beta(1,1.5)에서 샘플링된다. 학습 시 각 샘플은 per-dimension 슬롯 마스크, 단계 유효성 마스크, 가시성 마스크 등의 AND 결합으로 손실이 적용되는 위치를 제한해 결손 차원이나 이상 구간이 기울기에 영향을 주지 않게 했다. 추론은 4단계 Euler 통합으로 실시간 조건을 만족하도록 설계되었다. 카메라 기하학 처리는 CaPE(Camera Positional Encoding)를 도입해 각 어텐션 헤드의 64차원 중 32차원을 카메라 포즈 인코딩에 할당하고 나머지 32차원은 RoPE로 시간 인덱싱에 사용했다. 이미지 패치의 정규화된 화소 좌표는 별도 선형층으로 투사해 토큰에 더해져 시야 및 FOV 정보를 제공한다. EEF 행동은 참조 카메라 프레임으로의 회전·병진 델타로 표현되며, 행렬 결합(외적/켤레)으로 카메라-프레임 표현을 얻는다(본문의 eq. (5) 참조). 인-컨텍스트 정책 적응은 최근 H개의 실행 청크(시각·상태·K-스텝 행동)를 토큰화해 VLM 입력에 포함시키는 unified injection을 기본으로 한다. 각 청크의 상태와 행동은 별도 MLP로 VLM 히든 차원(Dvlm)으로 투사되고 시간적 위치 임베딩과 슬롯 임베딩이 더해져 직렬화된다. 훈련 시 문맥 창을 에피소드 내부의 무작위 위치에서 샘플링해 모델이 단순한 '가장 최근 동작 복사' 휴리스틱을 학습하지 않도록 제어했다. 데이터 파이프라인은 다단계 정제 절차를 포함한다. 상태·동작 신호에 대해 급변 탐지, 트렌드 정렬(상태와 명령의 시간적 리드/래그 확인), 극값 제거, FK(URDF+Pinocchio) 일관성 검증, 베이스 프레임 정렬을 수행한다. 비주얼-상태 일치성은 URDF 투영과 SAM3 마스크 IoU로 검사하며, 언어 주석은 VLM 기반의 구조적 추론 전처리와 다중 모델 교차투표로 일관성 검사를 수행해 불일치 샘플을 제거했다.
한계점
인간-대-로봇 합성은 리타게팅 근사와 인페인팅 아티팩트를 포함해 합성 데이터와 실세계 간의 분포 차이를 야기한다. 핵심 OOD 평가는 주로 시뮬레이션 기반이며 훨씬 더 광범위한 실세계 환경과 조건에서의 평가가 필요하다. 현재 시스템은 고정된 행동 청크 길이와 원격 추론 지연을 보상하는 RTC 설계 때문에 서브-초 반응성이 요구되는 작업에는 제약이 있다.
실무 활용
QWEN-ROBOTMANIP은 다중 카메라 관측과 자연어 지시를 입력으로 실시간에 가까운 청크 단위 제어를 수행하며, 원격 서버 기반 추론과 Real-Time Chunking으로 네트워크 지연을 숨겨 실로봇 제어에 적용 가능하다. 사전학습된 모델을 소수의 텔레오퍼레이션 시연으로 빠르게 적응시키는 Few-shot SFT 절차가 실무 검증에서 유의미한 향상을 보였다.
- 로봇 시스템 통합 시 초기 정책으로 활용해 적은 데이터로 하드웨어별 파인튜닝 비용을 절감하는 전이 학습
- 인스트럭션 기반 작업(자연어 지시)에 대한 제로-숏 및 소수샷 실행이 필요한 로봇 어시스턴트 서비스
- 다형 로봇 팩트리에서 공통 작업(픽앤플레이스, 정렬, 포장 등)을 하나의 통일된 정책으로 운용해 유지관리 단순화
- 에고 비디오로부터 작업 데이터를 확장해 시뮬레이션 전용 데이터 부족을 해소하는 데이터 증식 파이프라인
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Camera-frame delta pose
- — 엔드이펙터 목표 자세를 로봇 기준이 아닌 카메라 좌표계로 투영한 상대동작 표현이다. 카메라-투-이펙터 외익스트린식을 사용해 원하는 EEF 변위를 카메라 프레임에서 표현하므로 시각적으로 유사한 동작이 서로 다른 로봇에서 수치적으로 근접하게 된다. 이 논문에서는 교체체 일반화를 위해 EEF 동작을 카메라 프레임 델타로 정렬하여 전이 성능을 끌어올렸다.
- Flow Matching
- — 노이즈와 목표 동작 사이의 선형 보간 신호에 대해 모델이 예측해야 하는 속도장(velocity field)을 학습하는 확률적 복원 목표이다. 본문에서는 action chunk a와 노이즈 ϵ을 혼합한 xt=(1−t)ϵ+t a를 만들고 모델이 a−ϵ를 예측하도록 MSE를 최소화했다. 확률적 타임스케일과 결합해 연속 동작 생성에 사용되었다.
- Diffusion Transformer (DiT)
- — 연속 행동 생성에 flow-matching 기반 디퓨전/흐름 복원 목표를 적용한 Transformer 기반 액션 전문가 네트워크이다. 본 논문에서는 N=10 블록, Dact=768 구조로 state/action 시퀀스의 자기-어텐션과 VLM의 마지막 레이어에 대한 교차-어텐션을 교차로 수행해 시각·언어 문맥에 기초한 연속 동작을 복원했다.
- MANO
- — 인간 손의 관절 파라미터를 낮은 차원으로 표현하는 아티큘레이션 손형 모델이다. 이 논문에서는 여러 egocentric 소스의 손 포즈를 MANO 파라미터와 21 키포인트로 통일해 인간 손 궤적을 로봇 EEF로 리타게팅하는 기초로 사용했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.