본문으로 건너뛰기
HF Daily Papers조회 1

할 일을 배우기 전에 움직임을 학습하기: Vision-Language-Action을 위한 Task-Agnostic Pretraining

대형 Vision-Language-Action 모델의 성능은 전문적 인간 시연 데이터의 규모에 의해 엄격히 제한되는 경향이 있다. 이 논문은 물리적 동작 능력과 언어적 의미 정렬을 분리하여 값싼 무라벨 상호작용으로 먼저 물리적 모터 프라이어를 학습하면 전문가 라벨 의존도를 크게 낮출 수 있음을 실험적으로 입증했다. 그 결과 적은 전문가 데이터로도 행동 복제 대비 평균 성능이 10%p 향상되고, 실제 로봇에서 심한 시각 교란 상황에서도 더 높은 견고성을 유지했다.

용어 해설

역동역학 추정(Inverse Dynamics)
두 시점의 관찰(ot, ot+1)을 입력으로 받아 그 사이에 발생한 행동(at)을 예측하는 자기지도학습 목표이다. 이 목표는 시각 인코더가 배경 잡음을 무시하고 엔드이펙터 움직임과 객체 변위 같은 동적 요소에 집중하도록 강제한다. 본문에서는 이 손실을 평균제곱오차(MSE)로 최적화하여 물리적 모터 프라이어를 학습하는 핵심 메커니즘으로 사용됐다.
행동 복제(BC)(Behavior Cloning)
전문가 시연(관찰, 언어, 행동) 쌍을 지도학습으로 모방하는 방식으로 정책을 학습하는 방법이다. 본문에서는 Stage 2에서 언어 조건을 포함한 소량의 전문가 데이터를 사용하여 사전학습된 표현을 동작 공간에 정렬하기 위해 BC 손실을 최소화했다. 이 방법은 태스크별 의미 정렬을 학습하지만 물리적 동작 능력은 사전학습에 의해 크게 좌우된다.
Open X-Embodiment (OXE)(Open X-Embodiment)
다양한 로봇 몸체와 시연을 통합한 대규모 전문가 데이터셋으로, 수백만 건의 언어 주석이 달린 전문가 궤적을 포함한다. 기존 대형 VLA 모델들은 이 데이터에 의존해 확장된 일반화 성능을 달성했으나 수집 비용이 매우 높다. 논문에서는 OXE를 비교 기준으로 삼아 TAP가 적은 라벨로 동등하거나 우수한 성능을 내는지를 검증했다.
델타 포즈 행동 표현(Delta-Pose Action)
엔드이펙터의 상대적 위치 변화(Δx,Δy,Δz), 방향 변화(3차원 axis-angle), 그리고 그리퍼 명령을 포함하는 7차원 행동 표현 방식이다. 상대 변화를 예측하면 전역 좌표계에 무관한 지역적 상호작용 역학을 학습할 수 있어 다른 로봇/워크스페이스로의 전이가 용이해진다. 본 논문에서는 이 표현을 액션 공간으로 채택해 ID 및 BC 학습에 사용했다.

코드 예제

text
Algorithm 1 Constrained Procedural Trajectory Generation
0: Raw teleoperation poses P_raw, safety bounds B, voxel size v_size, min distance d_min, elevation threshold z_thresh, max high-elevation steps c_max, noise scale σ.
0: Procedural trajectory dataset D_play
1: Phase 1: Safe Pose Library Initialization
2: P_valid ← { p ∈ P_raw ∣ p ∈ B }
3: P_safe ← VoxelGridDownsample(P_valid, v_size)
4: Phase 2: Autonomous Data Collection
5: D_play ← ∅
6: while True do
7: W ← SampleWaypoints(P_safe, d_min)
8: W_contact ← ContactHeuristic(W, z_thresh, c_max)
9: τ ← CosineInterpolate(W_contact)
10: τ ← Clip(τ + N(0, σ), B)
11: Execute τ and append recorded transitions to D_play
12: if human intervention triggered (e.g., Δt ≥ 30 mins) then
13: Shuffle or swap objects in the workspace
14: end if
15: end while
16: return D_play

이 유사 코드 블록은 자율 무라벨 탐사 데이터를 안전하게 수집하기 위한 절차적 궤적 생성 파이프라인을 나타낸다. 원시 원격조종 포즈에서 안전 영역을 필터링하고 Voxel Grid로 다운샘플링한 뒤 확률적 웨이포인트 샘플링, 접촉 휴리스틱, 코사인 보간, 경계 인지 노이즈 주입을 거쳐 실행 가능한 연속 궤적을 생성한다. 이 파이프라인은 Stage 1 자기지도 Inverse Dynamics 학습에 필요한 접촉이 풍부한 데이터 다양성을 확보하는 데 사용됐다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 02.수집 2026. 07. 04.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.