TL;DR
비전 기반 월드 모델은 로봇 조작에서 시뮬레이션과 정책 학습을 위해 중요한 시각적 미래 예측을 제공한다. 그러나 기존 비디오 생성기는 접촉이 많은 조작 상황에서 궤적 단절, 객체 침투, 비현실적 상호작용과 같은 물리적 위반을 반복했고 이는 세계 모델로서 신뢰도를 떨어뜨렸다. PhysisForcing는 물리-정보가 풍부한 영역에 계층적 물리 정렬을 주입해 픽셀 수준의 연속성과 시맨틱 수준의 관계 일관성을 동시에 강화함으로써 생성의 물리 타당성과 downstream 정책 성능을 동시에 향상시켰다.
왜 중요한가
비전 기반 월드 모델은 로봇 조작에서 시뮬레이션과 정책 학습을 위해 중요한 시각적 미래 예측을 제공한다. 그러나 기존 비디오 생성기는 접촉이 많은 조작 상황에서 궤적 단절, 객체 침투, 비현실적 상호작용과 같은 물리적 위반을 반복했고 이는 세계 모델로서 신뢰도를 떨어뜨렸다. PhysisForcing는 물리-정보가 풍부한 영역에 계층적 물리 정렬을 주입해 픽셀 수준의 연속성과 시맨틱 수준의 관계 일관성을 동시에 강화함으로써 생성의 물리 타당성과 downstream 정책 성능을 동시에 향상시켰다.
관련 Figure

해당 도판은 물리적으로 비합리적 생성 예시와 PhysisForcing 적용 후의 합리적 생성 예시를 나란히 제시해 방법의 목적과 효과를 직관적으로 확인하게 한다. 중앙 블록은 물리-정보 영역 추출, 픽셀 궤적 정렬, 시맨틱 관계 정렬의 파이프라인을 단계별로 연결해 방법론의 전체 구조를 한눈에 보여준다. 이 그림은 왜 로컬과 글로벌 정렬을 동시에 적용해야 하는지를 시각적 근거로 보강한다.
PhysisForcing의 개요를 보여주는 티저 도판으로 픽셀 수준과 시맨틱 수준의 계층적 정렬이 중간 DiT 피처에 주입되어 물리적 일관성을 개선하는 흐름을 요약한다.
핵심 기여
지역 집중형 계층적 물리 정렬 프레임워크
PhysisForcing는 물리적으로 정보가 풍부한 영역을 먼저 식별한 뒤 해당 영역에만 감독을 집중하는 구조를 도입했다. 이 접근은 배경 픽셀에 균등한 재구성 손실을 적용하는 기존 방식이 물리 신호를 희석하는 문제를 해결한다. 물리적 핵심 영역에 픽셀 수준과 시맨틱 수준 손실을 병렬 적용해 로컬 동작과 글로벌 상호작용을 동시에 정렬했다.
픽셀 수준 궤적 정렬 손실
중간 DiT 피처를 경량 MLP로 변환해 프레임별 키-쿼리 유사도를 계산하고 Softmax 기반 좌표 기댓값으로 각 포인트의 예측 위치를 얻는다. CoTracker3로부터 추출한 레퍼런스 궤적과 물리 마스크로 가린 상태에서 마스크된 MSE를 계산해 궤적 불연속과 접촉 비합리성을 직접 억제한다. 이 손실은 로컬한 동작 오류를 가장 효과적으로 줄여 단일 구성요소로도 큰 성능 향상을 보였다.
시맨틱 수준 관계 정렬 손실
동결된 비디오 이해 인코더(V-JEPA)의 토큰 간 유사도 행렬을 DiT 측 토큰 유사도와 동일한 토큰 셋에서 L1로 정렬해 전역적 상호작용 일관성을 이식했다. 물리 마스크로 선택한 토큰들에서만 관계 행렬을 계산해 배경의 잡음을 배제했고, 그 결과 그립퍼-객체 결합이나 밀기 동작의 결과 같은 상호작용 결과가 더 일관되게 유지됐다. 이 손실은 픽셀 수준 손실과 상보적으로 작동해 전역적 오류를 보정했다.
학습 시의 확장성 및 추론 비용 제로
모든 보조 모델(CoTracker3, V-JEPA)은 학습 단계에서만 사용되며 추론 시에는 제거된다. 따라서 PhysisForcing는 추가 추론 비용을 발생시키지 않으면서 기존 사전학습 DiT 기반 백본을 미세조정하는 형태로 적용 가능하다. 대규모 로봇 영상 데이터에 대해 스케일링 가능하다는 점을 실험으로 검증했다.
핵심 아이디어 이해하기
로컬 픽셀 움직임과 전역적 시맨틱 관계는 조작 영상의 물리적 타당성을 결정하는 서로 다른 수준의 신호이다. 픽셀 수준에서는 각 점의 시간적 연속성과 깊이 일관성이 중요하며, 시맨틱 수준에서는 객체들 간의 상대적 관계가 상호작용 결과를 결정한다. 기존의 균등한 재구성 목표는 이러한 국소적·전역적 신호를 동시에 포착하지 못하고 배경 픽셀로 인해 물리적 단서가 희석된다. PhysisForcing는 먼저 포인트 트래킹 기반의 운동량과 초깃프레임 깊이를 결합해 물리-정보가 풍부한 영역을 추출한다. 이 마스크는 감독을 필요한 영역에만 집중시키는 역할을 하며, 마스크로 선택된 토큰과 픽셀에서만 추가 물리 손실을 적용한다. 이렇게 하면 잡음이 많은 배경이 학습 신호를 약화시키는 문제를 완화할 수 있다. 픽셀 수준 정렬은 중간 DiT 피처를 쿼리로 사용해 각 추적 포인트의 예측 좌표를 Softmax 좌표 기댓값으로 계산하고, CoTracker3로부터 얻은 레퍼런스 좌표와 마스크된 MSE로 차이를 줄인다. 이 과정은 어떤 값을 입력으로 받는지, 어떤 계산을 거쳐 좌표가 생성되는지를 명확히 규정하여 로컬 궤적 연속성을 직접적으로 목표로 삼는다. 시맨틱 수준 정렬은 동결된 V-JEPA 인코더의 토큰 간 유사도 행렬을 DiT 측 유사도와 맞추어 지역들 간의 상호관계 구조를 전달하며, 이 조합이 로컬 실패모드와 전역 실패모드를 동시에 보완한다.
방법론
전체 파이프라인은 사전학습된 DiT 기반 비디오 생성 백본을 미세조정하는 형태로 동작한다. 입력 비디오에서 CoTracker3로부터 밀집 포인트 궤적을 얻고, 초깃프레임의 깊이 추정값을 이용해 각 포인트에 전경 가중치를 부과해 물리 점수 q_i를 계산한 뒤 평균 임계값으로 마스크를 생성한다. 이 물리 마스크는 추후의 픽셀 수준과 시맨틱 수준 정렬에서 토큰·픽셀 선택에 사용된다. 픽셀 수준 정렬에서는 DiT의 중간층 출력 H^l를 ϕ(·)로 정제해 프레임별 피처 맵으로 재구성하고, 첫 프레임 피처 Q와 나머지 프레임의 K_t를 내적해 유사도 지도를 만든다. 그 지도에 대해 공간적 Softmax를 취한 뒤 좌표 기댓값을 계산하면 예측 좌표 p^{i}^{t}가 얻어지고, 이 예측 궤적과 CoTracker3의 레퍼런스 궤적 간의 마스크된 MSE가 픽셀 손실 L^{phy}{pix}가 된다. 이 손실은 학습 도중 중간 DiT 블록에 직접 적용돼 모델의 표현을 물리적으로 정렬한다. 시맨틱 수준 정렬에서는 동결된 비디오 이해 인코더 Φ_u(·)로부터 얻은 토큰 피처 F^u와 DiT 측 ψ(H^l)를 보간·패딩으로 동일한 토큰 레이아웃으로 맞춘 뒤 물리 마스크로 선택한 K개의 토큰에서 각 쌍의 코사인 유사도를 계산한다. 두 관계 행렬 R와
관련 Figure

이 도판은 물리 마스크 M^{phy} 생성 절차와 중간 DiT 블록에서의 특징 추출 및 세부 손실 계산 과정을 계층적으로 정리해 구현 관점의 흐름을 제공한다. 픽셀 정렬에서는 쿼리-키 기반 좌표 예측, 시맨틱 정렬에서는 토큰 유사도 행렬 계산 및 L1 정렬의 구체적 연산이 연결되어 있어 논문의 핵심 수식(식 6-12)의 역할을 이해하는 데 유용하다. 학습 시 보조 모델의 위치와 추론 시 제거되는 점도 시각적으로 표시되어 실무 적용 가능성을 보여준다.
방법론 도판으로 물리 영역 추출, WanVAE/DiT 인코더-디코더 흐름, 픽셀 및 시맨틱 정렬 손실의 수학적 구성 요소를 단계별로 배치했다.
주요 결과
PhysisForcing는 R-Bench, PAI-Bench, EZS-Bench에서 백본별로 일관된 성능 향상을 보였다. Wan2.2-I2V-A14B에 적용된 PF-Wan은 R-Bench에서 평균 점수 62.0을 기록해 베이스 대비 22.3% 향상을 달성했고 Cosmos3-Nano에 적용된 PF-Cosmos는 R-Bench에서 63.8을 기록해 베이스 대비 9.2% 향상했다. PAI-Bench 로봇 도메인에서는 PF-Cosmos가 85.2로 최고 성능을 달성했고 EZS-Bench에서는 PF-Cosmos가 81.1로 최상위를 기록했다. 구성요소별 실험에서 픽셀 수준 손실 L^{phy}{pix}와 시맨틱 손실 L^{phy}{sem}은 상호 보완적임이 관찰됐다. Wan2.2-TI2V-5B 기반에서 각 손실은 미세조정 기준 44.8에서 각각 47.2와 46.2로 개선되었고 두 손실을 결합하면 47.5로 추가 상승했다. 물리 영역 집중(ablation) 실험은 동일 손실을 모든 토큰에 적용할 때보다 마스크 기반 토큰 선택이 과제 차원에서 더 큰 이득(Tasks 35.4 → 38.9)을 가져온다는 결과를 제시했다. 로봇 정책 학습 측면에서는 PhysisForcing로 학습된 Wan2.2-TI2V-5B가 Fast-WAM 백본으로 사용될 때 전체 과제 평균 성공률을 68.2%에서 72.8%로 끌어올렸다. WorldArena 액션 플래너 규약 하에서 폐쇄 루프 성공률은 16.0%에서 24.0%로 상승해 다른 월드 모델 플래너들을 능가했다. 이러한 결과는 물리적으로 정렬된 비디오 표현이 downstream 행동 모델의 표현력과 계획 품질을 동시에 개선함을 시사한다.
관련 Figure

이 차트는 PhysisForcing 적용 전후 및 다른 상용·오픈소스 모델과의 직접 비교를 수치로 제시하며 PF-Cosmos가 85.2로 가장 높은 평균점을 기록한 사실을 시각적으로 확인하게 한다. 차트는 품질 및 도메인 점수의 평균을 사용해 평가 기준을 통일했고, 이는 논문 본문에 제시된 수치와 일관된다. 결과 패널은 PhysisForcing가 다양한 백본과 벤치마크에서 일관된 개선을 달성했음을 보강한다.
PAI-Bench 로봇 도메인에서 모델별 평균 점수를 막대그래프로 비교한 결과 도표로 PF-Cosmos가 최고 점수를 기록했다.

이 도표는 학습에 의존하지 않는 제로샷 상황에서 PhysisForcing의 일반화 성능을 보여주며 PF-Cosmos가 다른 모델들을 앞선다는 점을 정량적으로 제시한다. EZS-Bench는 훈련 분포 밖의 과제들을 포함하므로 이 차트는 방법의 OOD 일반화 강점을 보완적인 증거로 제시한다. 차트의 수치와 본문 비교는 논문의 주장과 일치한다.
EZS-Bench의 제로샷 평가 결과를 막대그래프로 나타낸 도판으로 PF-Cosmos가 최고 성능을 기록했다.

해당 스냅샷들은 베이스라인이 객체 침투나 그립퍼-객체 분리 같은 물리적 오류를 보이는 반면 PF-Cosmos는 접촉 유지와 객체 이동의 일관성을 더 잘 보존하는 사례들을 보여준다. 프롬프트는 '빨간 사과를 두 번째 레벨 플랫폼으로 이동'으로 동일하므로 비교는 조작 결과의 물리 타당성에 집중된다. 이 질적 비교는 정량적 벤치마크 결과를 보완해 방법의 실제 조작 시나리오 적용 가능성을 강화한다.
질적 비교 이미지 그리드로 여러 모델이 동일 프롬프트를 생성한 프레임들을 나열해 PhysisForcing의 물리적 일관성 개선을 시각적으로 제시한다.

이 학습 곡선은 L^{phy}_{pix}와 L^{phy}_{sem}가 개별적으로도 이득을 주지만 두 손실을 결합한 PhysisForcing가 모든 체크포인트에서 최상위 성능을 보였다는 점을 정량적으로 증명한다. 곡선은 20k 스텝에서 최고점을 찍고 이후 경미한 성능 저하가 발생하는 것을 보여주며, 이는 논문에서 보고된 과적합 경향과 일치한다. 이 도표는 손실들의 보완성 및 학습 안정성 관련 주장을 강화하는 근거로 사용된다.
학습 스텝에 따른 PAI-Bench 로봇 도메인 점수 곡선으로 픽셀·시맨틱 손실의 결합이 훈련 전반에서 우수한 성능을 유지함을 보여준다.
기술 상세
전체 아키텍처는 사전학습된 DiT 기반 비디오 생성 모델을 중간층에서 정렬 손실로 규제하는 구조다. 입력 비디오는 먼저 CoTracker3로 밀집 포인트 궤적을 얻고 초깃프레임 깊이로 전경 가중치를 계산해 물리 마스크 M^{phy}를 생성한다. 이 마스크는 픽셀 수준과 토큰 수준에서 감독 대상 영역을 선별하는 데 사용되며, 학습 후 해당 보조 모듈은 제거된다. 픽셀 수준 정렬은 DiT의 중간 피처 H^{l}를 경량 MLP ϕ(·)로 변환해 프레임별 특징 맵
한계점
논문에서 명시된 한계로 학습 단계에서 약간의 과적합이 관찰되어 학습 스텝이 증가한 뒤 성능이 일부 감소하는 경향이 보고되었다. 정렬 손실이 중간층 한 블록에 적용되므로 블록 선택이 성능에 영향을 미치며 최적의 레이어(논문에서는 layer 15)가 필요하다. 본 방법은 학습 시 CoTracker3와 V-JEPA 같은 보조 모듈에 의존하므로 이들 모듈의 품질이 낮으면 정렬 신호가 약화될 가능성이 있다.
실무 활용
PhysisForcing는 학습 단계에서만 보조 모델들을 사용하고 추론 시에는 추가 비용을 발생시키지 않으므로 기존 DiT 기반 비디오 백본을 가진 시스템에 실용적으로 적용 가능하다. 로봇 데이터 생성, 월드 모델링, 그리고 정책 학습에 필요한 물리 타당한 시각적 예측을 제공해 데이터 효율성과 계획 성능을 개선한다. 논문에서는 Fast-WAM과 WorldArena 규약을 통해 downstream 정책 성능 향상을 실증했다.
- 로봇 조작 시뮬레이터에서 현실적인 시각적 롤아웃을 합성해 데이터 증강과 시뮬레이션 기반 학습에 사용한다.
- 월드 모델 기반 액션 플래너의 예측 롤아웃을 물리적으로 정렬된 비디오로 대체해 폐쇄 루프 계획의 성공률을 높인다.
- 접촉이 빈번한 조작 과제들에서 정책 학습용 시각적 표현을 보강해 소수 샷 학습 및 도메인 일반화 성능을 개선한다.
코드 공개 여부: 미확인
키워드
용어 해설
- Physics-informative region
- — 로봇 조작 영상에서 조작기, 접촉면, 움직임이 큰 전경 픽셀들을 지칭한다. 이 논문에서는 포인트 트래킹과 초깃프레임 깊이 기반 가중치를 결합해 각 포인트의 물리 중요도를 계산하고, 평균 임계값으로 물리 마스크를 생성해 감독을 집중한다. 이 영역은 픽셀 수준 궤적 정렬과 토큰 간 관계 정렬의 감독 대상을 제한하는 데 핵심적이다.
- Pixel-level trajectory alignment
- — DiT의 중간 피처에서 쿼리-키 유사도로 프레임 간 좌표를 예측하고 CoTracker3로부터 얻은 레퍼런스 궤적과 마스크된 MSE로 차이를 줄이는 손실이다. 쿼리 특징을 첫 프레임에서 추출하고 Softmax 기반 좌표 기댓값으로 각 포인트의 예측 위치를 계산해 연속성과 접촉 호환성을 강제한다. 로컬한 궤적 불연속과 객체 침투와 같은 실패 모드를 직접 억제하는 역할을 한다.
- Semantic-level relational alignment
- — 동결된 비디오 이해 인코더(V-JEPA)의 토큰 간 유사도 행렬과 DiT 측의 토큰 유사도 행렬을 동일 해상도 토큰 집합에서 L1 손실로 정렬하는 기법이다. 물체와 그립퍼, 접촉 영역 등 지역들 간의 상호관계가 시간에 따라 일관되게 변화하도록 유도해 전역적 상호작용 오류를 개선한다. 픽셀 수준의 국소 제약과 보완적으로 작동한다.
- CoTracker3
- — 프레임 간의 밀집 포인트 트래킹을 제공하는 외부 모듈로, 각 픽셀에 대해 시간 축상의 2D 좌표 궤적을 반환한다. 본 논문에서는 CoTracker3로부터 얻은 레퍼런스 궤적을 픽셀 수준 정렬 손실의 감독 타깃으로 사용하며, 이를 통해 물리-정보 마스크와 궤적 MSE 계산이 가능해진다. 학습 시 보조 모델로만 사용되며 추론 시에는 제거된다.
- V-JEPA
- — 자기지도 방식으로 학습된 비디오 이해 인코더로, 토큰 간 관계 구조를 신뢰할 수 있는 측정 공간으로 제공한다. 본 논문에서는 이 인코더를 동결해 DiT의 토큰 관계 행렬과 정렬 목표를 구성함으로써 시맨틱 수준의 상호작용 일관성을 전송한다. 특징 차원 정렬을 위해 보간·패딩으로 토큰 레이아웃을 맞춘 뒤 관계 행렬 L1 손실을 적용한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.