본문으로 건너뛰기

PhysisForcing: 로봇 조작을 위한 물리 정렬 기반 비디오 월드 시뮬레이터

비전 기반 월드 모델은 로봇 조작에서 시뮬레이션과 정책 학습을 위해 중요한 시각적 미래 예측을 제공한다. 그러나 기존 비디오 생성기는 접촉이 많은 조작 상황에서 궤적 단절, 객체 침투, 비현실적 상호작용과 같은 물리적 위반을 반복했고 이는 세계 모델로서 신뢰도를 떨어뜨렸다. PhysisForcing는 물리-정보가 풍부한 영역에 계층적 물리 정렬을 주입해 픽셀 수준의 연속성과 시맨틱 수준의 관계 일관성을 동시에 강화함으로써 생성의 물리 타당성과 downstream 정책 성능을 동시에 향상시켰다.

용어 해설

물리 정보가 풍부한 영역(Physics-informative region)
로봇 조작 영상에서 조작기, 접촉면, 움직임이 큰 전경 픽셀들을 지칭한다. 이 논문에서는 포인트 트래킹과 초깃프레임 깊이 기반 가중치를 결합해 각 포인트의 물리 중요도를 계산하고, 평균 임계값으로 물리 마스크를 생성해 감독을 집중한다. 이 영역은 픽셀 수준 궤적 정렬과 토큰 간 관계 정렬의 감독 대상을 제한하는 데 핵심적이다.
픽셀 수준 궤적 정렬(Pixel-level trajectory alignment)
DiT의 중간 피처에서 쿼리-키 유사도로 프레임 간 좌표를 예측하고 CoTracker3로부터 얻은 레퍼런스 궤적과 마스크된 MSE로 차이를 줄이는 손실이다. 쿼리 특징을 첫 프레임에서 추출하고 Softmax 기반 좌표 기댓값으로 각 포인트의 예측 위치를 계산해 연속성과 접촉 호환성을 강제한다. 로컬한 궤적 불연속과 객체 침투와 같은 실패 모드를 직접 억제하는 역할을 한다.
시맨틱 수준 관계 정렬(Semantic-level relational alignment)
동결된 비디오 이해 인코더(V-JEPA)의 토큰 간 유사도 행렬과 DiT 측의 토큰 유사도 행렬을 동일 해상도 토큰 집합에서 L1 손실로 정렬하는 기법이다. 물체와 그립퍼, 접촉 영역 등 지역들 간의 상호관계가 시간에 따라 일관되게 변화하도록 유도해 전역적 상호작용 오류를 개선한다. 픽셀 수준의 국소 제약과 보완적으로 작동한다.
CoTracker3
프레임 간의 밀집 포인트 트래킹을 제공하는 외부 모듈로, 각 픽셀에 대해 시간 축상의 2D 좌표 궤적을 반환한다. 본 논문에서는 CoTracker3로부터 얻은 레퍼런스 궤적을 픽셀 수준 정렬 손실의 감독 타깃으로 사용하며, 이를 통해 물리-정보 마스크와 궤적 MSE 계산이 가능해진다. 학습 시 보조 모델로만 사용되며 추론 시에는 제거된다.
V-JEPA 인코더(V-JEPA)
자기지도 방식으로 학습된 비디오 이해 인코더로, 토큰 간 관계 구조를 신뢰할 수 있는 측정 공간으로 제공한다. 본 논문에서는 이 인코더를 동결해 DiT의 토큰 관계 행렬과 정렬 목표를 구성함으로써 시맨틱 수준의 상호작용 일관성을 전송한다. 특징 차원 정렬을 위해 보간·패딩으로 토큰 레이아웃을 맞춘 뒤 관계 행렬 L1 손실을 적용한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 26.수집 2026. 06. 30.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.