왜 중요한가
대규모 로봇 시연 데이터가 많을수록 정책 품질이 자동으로 개선되지 않는 현실에서, 시연 내부의 재사용 가능한 구조를 찾는 것은 데이터 효율을 높이는 핵심 신호이다. 본 연구는 시연을 프리미티브와 전이 인터페이스로 분해하여 어떤 시연이 장기 행동을 재현하는 데 유익한지를 수치적으로 평가하는 새로운 기준을 제시했다. 이 방법은 데이터 양을 줄이면서도 학습 성능과 일반화 능력을 개선할 수 있음을 실험적으로 입증했다.
핵심 기여
프리미티브-조합 관점의 궤적 효용 정의
시연을 재사용 가능한 visuo-motor 프리미티브와 이들을 잇는 전이 인터페이스의 조합으로 해석하여 중간 수준의 효용 신호를 도입했다. 이 관점은 궤적 전체 점수나 개별 상태-행동 신호의 단점을 보완하며, 반복적으로 등장하는 행동 소구조를 학습자에게 노출시키는 것이 중요하다는 근거를 제공했다. 프리미티브 발견은 세그먼트 표현을 클러스터링하고 재사용성과 궤적 판별성을 함께 고려해 어휘 크기를 자동 선택하도록 설계되었다.
구조적 노출(Structural Exposure) 목적함수와 예산 배분
프리미티브와 전이에 대해 가중치를 부여하고 로그 감가를 적용한 목적함수를 정의하여 조합 패턴 공간에 선택 예산을 할당했다. 이 목적함수는 재사용성이 높은 프리미티브·전이가 더 큰 이득을 제공하도록 설계되며, 감가상각으로 인해 반복 과다 노출을 억제하고 다양성 확보를 유도했다. 최적화는 단일 샘플 단위의 탐욕적(greedy) 증분 선택으로 구현되어 대규모 패턴 공간에서 실용적이다.
모방학습 친화적 메도이드 기반 궤적 선택
각 조합 패턴 버킷 내에서 세그먼트 표현을 연결한 궤적 임베딩을 사용해 코사인 유사도로 메도이드를 찾고 메도이드 중심에 가까운 궤적을 우선 보존했다. 이 방식은 동일 패턴 내에서 이상치나 일관성 낮은 행동을 배제하여 행동복제(Behavior Cloning) 학습의 감독 신호를 안정화했다. 버킷 내에서 무작위나 최대 다양성 선택으로 성능이 저하되는 반면 메도이드 중심 선택은 일관된 성능 향상을 낳았다.
다중 데이터셋·모델에서의 실험적 검증
Bridge-V2, Fractal, GR00T-X-Sim 등의 서로 다른 데이터셋과 Qwen3-VL-4B-GR00T/OFT 모델에서 SIEVE를 평가했고, 50% 데이터·50% 학습 스텝 설정에서 Full-Training 대비 우수한 평균 성공률을 보였다. 특히 Bridge-V2에서 50% 데이터와 25K 스텝으로 평균 성공률 56.3%를 달성해 Full-Training(51.8%)을 상회했다. 추가적인 제거 실험으로 프리미티브·전이 항의 기여와 메도이드 선택의 중요성을 확인했다.
핵심 아이디어 이해하기
대규모 시연 데이터셋은 중복, 저품질 시연, 편향된 태스크 분포를 포함할 수 있어 단순히 데이터량을 늘리는 것이 정책 성능을 보장하지 않는다. 기존의 궤적 수준 점수나 상태-행동 수준 점수는 각각 전역적 구조를 무시하거나 지역적 신호에만 집중하여 장기적인 행동 조합을 포착하지 못하는 한계를 가졌다. 이 논문은 궤적을 재사용 가능한 프리미티브와 그 사이의 전이로 분해하면 장기 행동의 재사용 구조를 중간 수준에서 포착할 수 있다는 직관에서 출발한다.
방법론
SIEVE는 세 단계로 구성된다. 첫째, 물리적으로 근거 있는 경계(그리퍼 상태 플립)를 사용해 궤적을 세그먼트로 나누고 각 세그먼트를 V-JEPA2로 인코딩한 뒤 시작·중간·종료 프레임 표현을 연결하고 PCA로 256차원으로 축소하여 세그먼트 표현을 얻는다. 둘째, MiniBatch K-Means로 세그먼트를 클러스터링해 프리미티브 어휘를 발견하며 어휘 크기 K는 재사용성(각 클러스터의 궤적 출현도)과 궤적 판별성(클러스터 커버리지의 Jaccard 유사도)을 결합한 기준으로 자동 선택한다.
관련 Figure

이 그림은 입력 궤적을 세그먼트화하고 V-JEPA2 표현을 사용해 클러스터링으로 프리미티브를 발견하는 절차를 시각화한다. 이후 조합 패턴 공간에서 프리미티브 및 전이의 재사용성을 가중치로 삼아 로그 감가 목적함수로 예산을 할당하고, 각 패턴 버킷에서 메도이드 중심 궤적을 선택하는 흐름을 연결해 SIEVE의 핵심 메커니즘과 설계 의도를 보강한다.
SIEVE의 전체 파이프라인을 개념적으로 보여주는 다단계 다이어그램으로, 프리미티브 발견, 구조적 노출 예산 배분, 메도이드 기반 궤적 선택 단계를 순서도로 표현하고 있다.
주요 결과
Bridge-V2에서 SIEVE는 50% 데이터와 25K 학습 스텝 조건에서 평균 성공률 56.3%를 기록해 Full-Training(51.8%)을 상회했고 같은 예산을 사용한 타 방법들(예: SCIZOR, DemInf, Random)을 일관되게 능가했다. 데이터셋 전반 성능 비교에서는 Bridge-V2, Fractal, GR00T-X-Sim에서 각각 56.3%, 76.4%, 54.8%를 기록하여 전체 데이터의 절반만 사용한 경우에도 일반화 성능이 유지되거나 개선되는 경향을 보였다. 제거 실험에서는 전이 항을 제거하면 평균 성공률이 50.8%로 하락했고 프리미티브 항을 제거하면 51.6%로 하락했으며, 버킷 내에서 가장 비유사한 궤적을 선택하면 성능이 40.1%로 크게 저하되어 설계 요소들의 실용성을 뒷받침했다.
관련 Figure

왼쪽 그래프는 원 데이터에서 몇몇 고빈도 단일 프리미티브 패턴이 지배적임을 보여주며, 오른쪽 그래프는 SIEVE가 선택한 샘플에서 멀티-프리미티브 패턴의 비중을 높여 조합적 다양성을 확장했음을 수치적으로 드러낸다. 이 시각적 증거는 로그 감가와 예산 재분배가 빈도 편향을 완화하고 구조적 노출을 넓힌다는 주장과 직접적으로 연결된다.
Bridge-V2에서 상위 50개 조합 패턴의 원 데이터 분포와 SIEVE 선택 후 분포를 비교한 바 차트로서, 선택 후 분포가 보다 균형화됨을 보여준다.
기술 상세
아키텍처 측면에서 SIEVE는 모델 구조를 변경하지 않고 데이터 선택만으로 동작하는 전처리 파이프라인이다. 세그먼트 표현은 V-JEPA2에서 추출한 start/mid/end 프레임 특징을 연결하고 PCA로 256차원으로 축소한 뒤 MiniBatch K-Means로 클러스터링하여 프리미티브를 형성한다. 세그먼트 분할은 그리퍼 상태 플립을 물리적 경계로 사용하며 상태 전이가 5프레임 연속 유지될 때만 경계로 인정하여 잔존 잡음을 낮춘다.
실무 활용
SIEVE는 대규모 로봇 시연 데이터셋에서 반복적이고 재사용 가능한 행동 구조를 찾아 소량의 데이터로도 효과적 정책 학습이 가능하도록 한다. 공개된 구현을 통해 실제 VLA 파이프라인의 데이터 전처리 단계에 통합하여 학습 비용과 시간 절감 효과를 기대할 수 있다. 메도이드 기반 선택으로 행동복제의 감독 신호가 안정화되어 하이퍼파라미터 정합 비용도 줄일 수 있다.
- 대규모 시연 데이터에서 계산 자원이 한정된 상황에서 훈련 데이터 축소 및 성능 유지
- 다중 태스크·다중 환경으로 수집된 시연의 구조적 다양성 확보 및 일반화 향상
- 데이터 레이블링 또는 휴먼-인-더-루프 검수에서 대표적 시연 샘플 우선 검토
- 시뮬레이션과 실제 데이터 혼합 시, 구조적 재사용성을 기준으로 샘플 균형 맞추기
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 시각-운동 프리미티브(Visuo-motor Primitive)
- — 시연을 구성하는 재사용 가능한 원자적 행동 단위로 정의되며, 영상 기반 표현을 통해 세그먼트 단위로 추출된다. 프리미티브는 서로 다른 시연에서 반복적으로 등장하면서 장기 행동을 구성하는 빌딩 블록 역할을 한다. SIEVE는 이러한 프리미티브를 찾아 조합 패턴의 분포를 최적화하는 신호로 활용한다.
- 조합 패턴(Composition Pattern)
- — 하나의 궤적을 순서화된 프리미티브 열로 표기한 것으로서 각 궤적의 구조적 형태를 포착한다. 동일한 조합 패턴에 속하는 궤적들은 같은 프리미티브와 전이 인터페이스를 공유하며 버킷으로 그룹화된다. SIEVE는 이 조합 패턴 공간에 예산을 배분하여 재사용 가능한 구조 노출을 극대화한다.
- 구조적 노출(Structural Exposure)
- — 선택된 데이터 집합이 포함하는 프리미티브와 전이의 총노출량을 가중치와 함께 계산한 측도로, 로그 함수로 감가상각을 반영한다. 높은 구조적 노출은 모델이 공유 행동 서브프로그램을 파라미터로 내재화할 기회를 증가시킨다. SIEVE는 이 값을 목적함수로 사용해 조합 패턴별로 시연을 배분한다.
- 메도이드 궤적(Medoid Trajectory)
- — 조합 패턴 버킷 내에서 다른 궤적들과의 표현 유사도를 합한 값이 최대인 중심 궤적으로서 이상치가 적고 일관된 행동을 제공한다. 메도이드를 기준으로 거리가 작은 궤적들을 선택하면 행동 복제 학습의 감독 신호가 안정화된다. SIEVE는 버킷 당 보유할 샘플을 메도이드 중심 거리로 정렬하여 확보한다.
- 궤적 분할(Trajectory Segmentation)
- — 그리퍼의 작동 상태 플립(grasp/release)처럼 물리적으로 근거 있는 경계를 사용해 연속 궤적을 세그먼트로 나누는 절차이다. 이 논문에서는 상태 전이가 5프레임 연속 지속될 때만 경계로 인정하여 노이즈를 억제했다. 분할된 세그먼트는 이후 V-JEPA2로 인코딩되어 프리미티브 발견의 입력이 된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.