왜 중요한가
VLA(vision-language-action) 정책은 학습 데이터에 있는 기술로만 작동하므로 새로운 조작 기술이 필요할 때마다 사람 시연이 필요하다. InSight는 VLM을 이용해 누락된 '프리미티브'를 자동으로 식별·수집·학습해 인간 시연 없이 새로운 스킬을 획득하고, 실제 실험에서 pouring 96%, 긴 단계 작업 80% 등의 높은 성공률을 보였다.
핵심 기여
자동 프리미티브 분할 파이프라인
teleoperation 데모를 gripper 상태 전이와 end-effector pose(우세 축 태그)로 분석하고, VLM이 생성한 primitive plan과 정렬하여 각 세그먼트에 자연어 레이블을 자동으로 할당한다. 이렇게 생성된 primitive 세그먼트는 primitive별로 LoRA를 이용해 VLA를 재학습하는 학습 사례가 된다.
VLM-유도 프리미티브 획득 루프
새로운 작업에서 VLM이 계획을 생성하고 현재 VLA vocabulary에 없는 primitive(primitive gap)를 식별한다. 각 gap은 단일 축(translation 또는 rotation)과 signed magnitude로 파라미터화되어 VLM이 제안한 값으로 로봇이 시도하고, VLM 오라클이 성공을 판정한 성공 롤아웃을 재학습 데이터에 추가해 VLA를 확장한다.
제로(대상 스킬) 인간 시연으로 실세계 기술 획득
pick-and-place 시연만으로 학습된 VLA에 대해 twisting·pouring·sweeping·block-flip 등 대상 스킬에 필요한 프리미티브를 자동 획득해 실세계에서 twisting 92%, pouring 96%, twist-then-pour 조합 80% 등의 성능을 달성했다. 또한 기존 기본 스킬은 합동 재학습 후에도 100% 유지되었다.
샘플 효율성: RL 대비 실용적 획득
simulation block-flip 실험에서 InSight는 rotate-block primitive를 246개의 획득된 롤아웃으로 추가해 최종 75% 성공률을 달성한 반면, 동일 예산의 SAC RL baseline은 플립을 완료하지 못했다(0%). 실제 하드웨어에서도 twisting은 23 trials로 20 성공 primitive를 얻는 등 실세계 샘플 비용이 낮다.
핵심 아이디어 이해하기
문제 출발점: VLA는 시각과 언어를 입력으로 저수준 제어를 출력하는 통합 정책이지만, 학습 데이터에 없는 동작은 실행하지 못한다. 기존 접근법은 VLM/LLM을 테스트타임 플래너로 써서 이미 학습된 스킬을 조합해 새로운 작업을 수행하려 했으나, 근본적으로 VLA의 표현력(학습된 primitive vocabulary)에 새로운 primitive를 추가하지 못하면 반복적 재사용과 지속적 학습이 불가능하다.
해결 원리: 조작 스킬을 '프리미티브'라는 재사용 가능한 단위로 분해하고, VLA를 primitive 레이블로 조건화해 primitive-level steerability를 확보한다. VLM은 주어진 작업을 primitive 시퀀스로 분해하고, VLA에 없는 primitive를 'primitive gap'으로 표시한다. 각 gap은 VLM이 제안한 단일 축(dx/dy/dz 또는 drx/dry/drz)과 signed magnitude로 파라미터화되어 로봇이 시도한다. 성공 롤아웃은 VLM 오라클로 판정되어 기존 데이터셋에 추가되고 VLA를 재학습해 어휘를 확장한다.
작동 메커니즘 연결: 데모 분할은 gripper open/close 전이 신호와 end-effector의 dominant-axis(예: {xy, z, rxy, rz}) 및 motion magnitude를 VLM 입력으로 주어 각 프레임을 primitive 이름에 매핑한다. VLA 학습은 각 primitive 세그먼트를 독립적인 에피소드로 취급하고, 프리미티브 종료를 위해 학습된 progress channel(0~1)을 추가해 프리미티브별 종료 시점을 제어한다. 이렇게 하면 VLA는 primitive label을 받아 해당 프리미티브를 end-to-end로 실행할 수 있고, VLM은 부족한 primitive를 찾아 보강 데이터를 자동으로 수집해 VLA를 확장한다.
무엇이 달라지는가: 단일 축으로 파라미터화한 primitive 획득 방식은 복잡한 다축 동작을 여러 개의 재사용 가능한 primitive로 분해해 샘플 효율을 높인다. 실험적으로 block flip에서는 246개의 획득 primitive 롤아웃으로 75% 성공률, 실제 환경에서 pouring은 96% 성공률, twist-then-pour 조합은 80% 성공률을 달성해 VLM-유도 데이터 플라이휠이 실세계 기술 확장에 실용적이라는 점을 보여준다.
방법론
전체 접근과 핵심 아이디어: InSight는 두 단계로 운영된다. Stage 1은 자동 primitive segmentation을 통해 human teleoperation 데모를 프리미티브별로 분할하고 각 세그먼트에 자연어 레이블을 정렬해 VLA를 프리미티브 조건화로 재학습한다. Stage 2는 VLM-guided acquisition 루프를 통해 새로운 작업에서 primitive gap을 식별하고 VLM 제안 파라미터로 로봇이 시도한 성공 롤아웃을 데이터셋에 되돌려 VLA를 확장하는 데이터 플라이휠이다.
관련 Figure

이 다이어그램은 Stage 1에서 gripper 상태 전이와 end-effector motion을 VLM-generated plan과 정렬해 primitive-labeled 세그먼트를 생성하는 과정을 시각화한다. Stage 2에서는 VLM이 primitive gap을 식별하고 단일 축 파라미터를 제안해 로봇이 시도한 성공 롤아웃을 다시 데이터셋에 추가하는 루프를 보여, 전체 방법론의 데이터 플라이휠 연결을 명확히 나타낸다.
InSight의 두 단계 파이프라인을 개요로 보여주는 다이어그램(자동 프리미티브 분할 → VLM-유도 획득 루프 → 재학습 및 조합).

이 스냅샷은 drawer-closing 과제가 base policy의 훈련 분포(닫힌 상태 접근)와 다른 OOD 초기 상태(열린 상태)에서 시작함을 시각적으로 보여준다. 본문은 VLM completion check가 OOD 상태에서 프리미티브 종료를 판정해 새로운 push-drawer-closed primitive를 트리거한 사례로 연결된다.
데모: Drawer Open과 New Skill: Drawer Close의 초기 상태 비교(Initial: CLOSED vs Initial: OPEN).
주요 결과
메인 벤치마크: 시뮬레이션 block-flip에서 InSight는 rotate-block primitive를 자동 획득해 최종 75% 성공률을 달성했다(246 successful acquired rollouts, 479 total attempts). 동일 예산의 SAC RL baseline은 flip을 완료하지 못했다(0%). 실세계에서는 twist 92%와 pour 96%의 end-to-end 성공률을 기록했고, twist-then-pour 조합은 80% 성공률을 기록해 CaP-X(4%) 및 π0.5(0% on these primitives)보다 월등히 높았다.
관련 Figure

그래프는 InSight가 획득한 rotate-block primitive 수에 따라 성공률이 상승함을 보이며, 246 성공 획득 롤아웃에서 75% 성공률에 도달했음을 보여준다. 동일 롤아웃 예산의 SAC baseline은 플립을 완료하지 못해(0%) 프리미티브 단위 획득이 샘플 효율 면에서 유리함을 근거로 제시한다.
Block-flip 샘플 효율성 그래프: 총 시도 대비 성공률, InSight와 RL baseline(SAC) 비교.

프레임 시퀀스는 InSight가 개별적으로 획득한 twist와 pour 프리미티브를 연결해 14-primitive의 장기 작업을 구성할 수 있음을 보여준다. 각 패널의 progress 수치는 학습된 progress channel이 프리미티브 경계와 종료를 어떻게 제어하는지 실증적으로 보여준다.
14-프레임으로 구성된 twist-then-pour 롤아웃의 프리미티브 시퀀스와 각 프리미티브의 progress 표시.

그래프는 InSight가 VLM 호출을 통한 '생각' 비용은 존재하지만 전체 실험당 wall-clock 시간이 CaP-X보다 짧아 효율적임을 보여준다. Table 1의 per-skill 누적 시간(로봇/ VLM/ wall)과 연결되어 InSight의 실세계 획득 비용 산정을 뒷받침한다.
실험별 시간 분해(Thinking: VLM latency, Execution: 로봇 동작) 비교 막대그래프(InSight vs CaP-X).

그래프는 InSight로 프리미티브를 추가하더라도 통합 VLA가 원래의 pick-and-place 기본 기술을 유지해(100% 유지 사례 포함) 연속 학습 중 기존 능력의 손상이 없음을 보여준다. 이는 retraining 시 기존 primitive를 계속 감독하는 데이터-centric 전략의 효과를 지지한다.
Base Skill Retention 막대그래프: π0.5 base와 InSight의 top/side pick-and-place 성공률 비교.
기술 상세
아키텍처 구조: VLA는 이미지 관찰과 자연어 primitive label을 입력받아 연속적 로봇 동작을 출력하는 end-to-end 정책이다. 각 primitive는 단일 dominant motion mode(translation 또는 rotation 축 또는 gripper transition)를 가지며, 학습 시 각 primitive 세그먼트가 별도 에피소드로 제공된다. 프리미티브 종료를 위해 정책에 progress channel을 추가해 [0,1) 값으로 진행도를 예측한다.
한계점
논문에서 명시한 한계: (1) primitive gap 실행은 단일 축 파라미터화로 제한되어 복잡한 다축 동작을 직접 획득하지 못한다. (2) 성공 롤아웃만 필터링해 실패 분석이나 실패로부터 학습하는 메커니즘이 포함되지 않았다. (3) 모든 실세계 롤아웃에서 환경 리셋에 사람의 개입이 필요하다. (4) 고차원 자유도(예: 모바일 매니퓰레이터, 휴머노이드)로의 확장성은 추가 연구 필요.
실무 활용
실세계 로봇에 기존 VLA를 기반으로 새로운 조작 기술을 자동으로 추가할 수 있는 파이프라인을 제공한다. GitHub 저장소가 공개되어 있어 재현 및 실무 시험 적용이 가능하다.
- 로봇 현장 운영 중 새로운 접촉 기반 조작(예: twisting, pouring, sweeping)을 인간 시연 없이 추가하는 자동화 파이프라인
- 산업용 셀에서 다종 작업이 요구될 때 VLM으로 누락된 primitive를 찾아 샘플링하고 VLA를 주기적으로 재학습해 지속적으로 기능 확장
- 시뮬레이션으로 수집한 primitive를 실제 로봇에서 VLM-유도 파라미터로 빠르게 보완해 sim-to-real 워크플로 단축
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Vision-language-action 모델(VLA)
- — 시각 관찰과 자연어 지시를 입력받아 로봇의 저수준 제어(연속 동작)를 출력하는 일체형 정책. 본 논문에서는 primitive label을 조건으로 단일 primitive를 실행하도록 학습된 정책을 의미하며, primitive-level steerability의 대상이다.
- Vision-language 모델(VLM)
- — 이미지(또는 이미지 시퀀스)와 텍스트를 함께 처리해 높은 수준의 계획·판단을 생성하는 모델. InSight에서는 작업을 primitive 시퀀스로 분해하고 누락된 primitive를 식별·매개변수화하는 데 사용된다.
- 프리미티브 분할(Primitive Segmentation)
- — 사람이 조종한 데모 궤적을 동작 단위(primitive)로 분할하고 각 세그먼트에 자연어 레이블을 정렬하는 과정. 본 논문은 gripper 상태 전이와 end-effector pose 기반 특징을 VLM과 정렬해 자동화했다.
- 누락된 프리미티브(Primitive Gap)
- — VLM이 계획한 primitive 시퀀스에 포함되지만 현재 VLA의 primitive vocabulary에 없는 원소. InSight는 이 primitive gap을 자동으로 파라미터화하고 성공 롤아웃을 수집해 vocabulary를 확장한다.
- 프리미티브 진행도 채널(Progress Channel)
- — 각 primitive 세그먼트 내에서 0~1의 값을 출력하는 학습된 신호로서 프리미티브 별 종료 시점을 제공한다. 프리미티브 단위 학습과 실행 종료 판정에 사용되어 체인된 primitive 실행을 가능하게 한다.
- 단일 축 파라미터화(Single-axis Parameterization)
- — 새로운 primitive를 획득할 때 VLM이 translation {dx,dy,dz} 또는 rotation {drx,dry,drz} 중 하나의 축과 signed magnitude를 제안하는 방식. 복잡한 다축 동작은 여러 primitive gap으로 분리된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.