용어 해설
- 물리 정보가 풍부한 영역(Physics-informative region)
- — 로봇 조작 영상에서 조작기, 접촉면, 움직임이 큰 전경 픽셀들을 지칭한다. 이 논문에서는 포인트 트래킹과 초깃프레임 깊이 기반 가중치를 결합해 각 포인트의 물리 중요도를 계산하고, 평균 임계값으로 물리 마스크를 생성해 감독을 집중한다. 이 영역은 픽셀 수준 궤적 정렬과 토큰 간 관계 정렬의 감독 대상을 제한하는 데 핵심적이다.
- 픽셀 수준 궤적 정렬(Pixel-level trajectory alignment)
- — DiT의 중간 피처에서 쿼리-키 유사도로 프레임 간 좌표를 예측하고 CoTracker3로부터 얻은 레퍼런스 궤적과 마스크된 MSE로 차이를 줄이는 손실이다. 쿼리 특징을 첫 프레임에서 추출하고 Softmax 기반 좌표 기댓값으로 각 포인트의 예측 위치를 계산해 연속성과 접촉 호환성을 강제한다. 로컬한 궤적 불연속과 객체 침투와 같은 실패 모드를 직접 억제하는 역할을 한다.
- 시맨틱 수준 관계 정렬(Semantic-level relational alignment)
- — 동결된 비디오 이해 인코더(V-JEPA)의 토큰 간 유사도 행렬과 DiT 측의 토큰 유사도 행렬을 동일 해상도 토큰 집합에서 L1 손실로 정렬하는 기법이다. 물체와 그립퍼, 접촉 영역 등 지역들 간의 상호관계가 시간에 따라 일관되게 변화하도록 유도해 전역적 상호작용 오류를 개선한다. 픽셀 수준의 국소 제약과 보완적으로 작동한다.
- CoTracker3
- — 프레임 간의 밀집 포인트 트래킹을 제공하는 외부 모듈로, 각 픽셀에 대해 시간 축상의 2D 좌표 궤적을 반환한다. 본 논문에서는 CoTracker3로부터 얻은 레퍼런스 궤적을 픽셀 수준 정렬 손실의 감독 타깃으로 사용하며, 이를 통해 물리-정보 마스크와 궤적 MSE 계산이 가능해진다. 학습 시 보조 모델로만 사용되며 추론 시에는 제거된다.
- V-JEPA 인코더(V-JEPA)
- — 자기지도 방식으로 학습된 비디오 이해 인코더로, 토큰 간 관계 구조를 신뢰할 수 있는 측정 공간으로 제공한다. 본 논문에서는 이 인코더를 동결해 DiT의 토큰 관계 행렬과 정렬 목표를 구성함으로써 시맨틱 수준의 상호작용 일관성을 전송한다. 특징 차원 정렬을 위해 보간·패딩으로 토큰 레이아웃을 맞춘 뒤 관계 행렬 L1 손실을 적용한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.





