왜 중요한가
로봇 조작에 필요한 행동은 3차원 공간에서의 정밀한 위치 및 시간적 연속성에 의존하기 때문에 단순한 2D 픽셀 예측만으로는 제어 신뢰성을 확보하기 어렵다. RynnWorld-4D는 색상, 깊이, 광류를 동기화해 기하학과 운동을 명시적으로 표현하므로 예측 피처가 로봇의 엔드이펙터 행동과 더 가깝게 매핑된다. 이로 인해 정책이 예측된 4D 표현을 직접 소비해 고주파 폐쇄형 제어를 수행할 수 있는 실용적 연결고리가 마련되었다.
핵심 기여
프로젝트 방식의 RGB-DF 4D 표현 도입
본 연구는 RGB, 깊이, 옵티컬 플로우를 동기화한 프로젝트식 4D 표현을 제안했다. 이 표현은 깊이로 픽셀을 3D로 역투영하고 광류로 시간적 대응을 연결해 측정 단위의 3D 장면 흐름을 계산할 수 있게 구성했다. 결과적으로 2D 영상 기반 예측과 비교해 기하학적 정합성과 운동 해석 가능성이 크게 향상되었다.
삼분기(트라이-브랜치) 확산 트랜스포머 아키텍처
기존의 단일 브랜치 비디오 확산 백본을 RGB, 깊이, 플로우 각 모달리티로 분기해 독립적 표현을 보존하면서 교차 모달 일관성을 유지하는 설계를 도입했다. Joint Cross-Modal Attention 모듈과 3D RoPE를 통해 프레임 단위 픽 정렬 기반의 모달 간 상호작용을 수행하도록 구성했다. 단계적 학습(모달 적응 → 동결된 JA 학습 → 전체 파라미터 SFT)을 통해 모달 분포 차이를 완화하며 안정적으로 수렴시켰다.
대규모 4D 학습 데이터셋 Rynn4DDataset 1.0 구축
연구진은 에고센트릭 인간 비디오와 로봇 조작 비디오를 합쳐 총 2억5천만 프레임 이상의 하이브리드 데이터셋을 구성했다. 각 프레임에는 Qwen3-VL로 생성한 캡션과 DPFlow로 계산한 광류, Depth Anything 3으로 예측한 단안 깊이의 고품질 의사 레이블이 포함되며 데이터 파이프라인은 원해상도 유지와 전처리 규칙을 적용했다. 이 대규모 사전학습 데이터가 존재함으로써 4D 예측 모델의 공간·시간 일반성이 확보되었다.
예측형 4D 잠복(latent)을 활용한 역동역학 정책 헤드
RynnWorld-4D의 내부 예측 잠복을 단일 포워드 패스로 추출해 Flow Former와 flow-matching 기반 정책 헤드로 행동을 생성하는 구조를 설계했다. 무거운 확산 디노이징을 매 행동 스텝마다 수행할 필요가 없어 실시간성 제약을 완화하고 K=10 동작 청크 예측으로 유효 제어 주파수를 끌어올렸다. 이 파이프라인은 실제 이중 손 조작 과제에서 정밀성과 시간 조율 측면에서 유의미한 성공률 향상을 보였다.
핵심 아이디어 이해하기
세계 모델이 로봇 제어에 유용하려면 단순한 색상 변화에 대한 픽셀 예측을 넘어 장면의 기하학적 구조와 시간적 운동을 명시적으로 포착해야 한다. RGB-D 입력은 각 픽을 3D 위치로 역투영할 수 있는 깊이를 제공하며 광류는 시간 기준의 픽 대응을 연결하므로 두 정보를 결합하면 측정 단위의 3D 장면 흐름을 얻을 수 있다. 이 논문은 이 결합 표현이 로봇의 엔드이펙터 동작과 자연스럽게 연결되는 표현 공간을 제공한다고 본다.
관련 Figure

그림의 좌측은 RGB와 깊이 입력을, 중앙은 세 모달리티의 시간적 프레임을 보여주며 우측은 역투영된 3D 포인트와 장면 흐름을 색으로 표시하고 있다. 이 시각 자료는 RGB-DF 표현이 어떻게 픽별 깊이와 광류를 결합해 3D 장면 흐름을 계산하는지와 생성 결과가 공간적으로 일관되도록 설계된 점을 직접적으로 전달한다. 모달 간 동기화와 3D 장면 흐름을 통한 물리적 해석 연결이 논문의 핵심 직관임이 확인된다.
입력 RGB-D 이미지와 언어 지시로부터 동기화된 RGB, 깊이, 옵티컬 플로우 비디오를 생성하고 이를 3D 장면 흐름으로 역투영하는 파이프라인 개요를 도식화한 그림이다.
방법론
전체 설계는 사전 학습된 비디오 확산 백본을 기반으로 RGB, 깊이, 광류의 세 분기를 갖는 트랜스포머로 확장하는 구조를 따른다. 각 분기는 자체 self-attention과 FFN을 유지해 모달 특성에 맞춘 표현을 학습하며 주기적으로 삽입되는 Joint Cross-Modal Attention 모듈이 다른 두 분기의 key/value를 사용해 동일 프레임 내 픽 단위의 교차 모달 정렬을 수행한다. 학습은 세 단계로 구성되어 첫 단계에서 분기별 적응을 통해 각 모달리티의 분포를 안정화하고 두 번째 단계에서 동결된 백본에 JA를 추가해 교차 모달 정합을 학습한 뒤 세 번째 단계에서 전체 파라미터를 미세조정해 최종 동기화를 달성했다.
관련 Figure

차트는 총 254.4M 프레임 중 인간 데모와 로봇 상호작용 시퀀스의 분포를 수치로 제시하며 로봇 데이터가 전체의 대부분을 차지한다는 사실을 보여준다. 이 시각은 학습 데이터의 스케일과 다양성이 모델의 기하·운동 학습에 중요한 역할을 했다는 근거를 제공한다. 데이터 출처별 비중은 모델의 일반화 성능 및 특정 작업에서의 우수성 해석에 직접적인 근거로 사용된다.
Rynn4DDataset 1.0의 구성 비율과 프레임 수 통계를 원형 차트로 정리한 데이터셋 구성 시각화이다.

이 패널은 역투영 공식과 마스킹 규칙을 적용해 깊이 불연속 구간의 아티팩트를 줄이는 처리 파이프라인을 시각적으로 확인할 수 있게 한다. 3D 장면 흐름의 색상 트레일은 예측된 움직임이 물리적으로 일관된 궤적을 형성함을 보이며 정책이 이를 통해 객체의 미래 위치를 안정적으로 예측할 수 있는 근거가 된다. 깊이 그래디언트 임계값 기반 마스킹은 노이즈로 인한 잘못된 장면 흐름 추적을 줄이는 실용적 세부로 나타난다.
모델의 정성적 예측 결과와 함께 깊이 그래디언트 기반 마스킹 및 3D 장면 흐름의 새깃 표현을 포함한 추가 시각화 패널이다.
주요 결과
4D 월드 모델 평가에서 RynnWorld-4D는 기존 비디오 생성 모델과 비교해 시각적 충실도는 유지하면서 깊이 및 운동 측정치에서 우수한 성능을 보였다. 논문 표에 따르면 δ1은 0.610을 기록해 이전 4D 모델보다 큰 폭으로 개선되었고 AEPE는 0.170으로 동적 정확성이 확보되었다. 정책 측면에서는 RynnWorld-4D-Policy가 Lid Placement와 Bowl Stacking 같은 고정밀 과제에서 약 65.7%의 성공률을 기록하며 Diffusion Policy 등 기존 접근보다 일관된 우위를 보였다.
관련 Figure

각 과제 사진은 이중 팔 조작과 고정밀 동작이 요구되는 환경을 보여주며 실험 설정의 다양성과 현실적 난이도를 직관적으로 전달한다. 이 시각 자료는 평가 메트릭인 성공률이 단순 시뮬레이션이 아니라 실제 물리적 상호작용에 기반해 측정되었음을 보강한다. 또한 특정 과제에서 깊이·광류 정보가 특히 유용했음을 실험 결과와 연결할 근거로 작용한다.
실제 로봇에 적용한 여섯 가지 조작 과제의 예시 사진으로 듀얼 픽킹, 블록 밀기, 핸드오버, 이중 리프팅, 뚜껑 배치, 그릇 적층을 포함한다.

격자 샘플은 다양한 장면과 조작 동작에서 깊이와 광류가 RGB 시각 변화와 일관되게 정렬되었음을 보여준다. 이러한 정성적 예시는 수치 지표가 포착하지 못하는 국소적 기하학적 일치성과 시간적 연속성을 보완하는 근거가 된다. 특히 깊이 단절부 처리와 흐름의 색상 인코딩이 실제 움직임과 정합성을 유지하고 있음을 확인할 수 있다.
다양한 소스 비디오에서 생성된 RGB, 깊이, 옵티컬 플로우의 정성적 샘플들을 격자 형태로 배열한 정성 평가 그림이다.
기술 상세
모델 아키텍처는 Wan-2.2-TI2V-5B를 기반으로 30개 트랜스포머 블록을 유지하면서 각 모달리티별로 분기해 총 세 개의 분기별 패치 임베딩, self-attention, LayerNorm, FFN을 복제해 초기화했다. Joint Cross-Modal Attention 모듈은 3층 간격(레이어 0,3,6,...,27)에 삽입되어 총 10개의 JA 모듈을 구성하며 각 JA는 쿼리로 한 분기의 토큰을, 합쳐진 K/V로 나머지 두 분기의 정보를 사용해 같은 시간 프레임 내에서만 교차 주의를 수행한다. 위치 인코딩으로는 3D RoPE를 적용해 픽 단위의 공간 정렬을 유지했고 초기화 전략으로는 출력 투영을 0으로 두고 게이트를 1로 둬 학습 초기에 잔차 경로가 안정적으로 작동하도록 설계했다.
관련 Figure

그림은 각 모달리티가 VAE 인코더로 잠복을 얻고 트랜스포머 블록 내에서 자기-어텐션과 교차-모달 어텐션을 통해 동기화되는 구조를 계층적으로 제시한다. 또한 텍스트 임베딩과 모달 결합 후 Flow Former 및 DiT 기반 정책 블록을 통해 행동을 생성하는 흐름을 명확히 보여주어 구현 복잡도와 모듈 간 책임 분리가 드러난다. 이 다이어그램은 논문에서 제시된 단계적 학습 전략과 분기별 초기화 의도를 이해하는 데 핵심적이다.
트라이-브랜치 아키텍처, VAE 인코더/디코더, Joint Cross-Modal Attention, 그리고 정책 헤드로 이어지는 전체 파이프라인 아키텍처 다이어그램이다.
한계점
첫째로 확산 기반 4D 시퀀스 생성은 계산 비용이 높아 모델의 전방향 예측 단계가 전체 추론 지연의 대부분을 차지했다. 실험 환경에서 전체 포워드 패스는 약 1.1초의 사이클 타임을 기록해 유효 제어 빈도는 약 9Hz 수준으로 제한되며 초고주파의 저수준 제어에는 적합하지 않다. 둘째로 데이터 구성과 모델 설계가 주로 에고센트릭 단일 뷰에 최적화되어 있어 다중 뷰나 협업 다중 로봇 환경으로 일반화하는 데 추가 연구가 필요하다.
실무 활용
실무적으로 RynnWorld-4D는 단일 RGB-D 카메라와 텍스트 지시를 입력으로 받아 예측형 4D 잠복을 생성하고 이를 정책 헤드가 직접 소비해 폐쇄 루프 제어를 수행하도록 구성되어 있다. 공개된 코드 저장소가 존재하므로 연구·응용팀은 모델과 데이터 파이프라인을 재현하거나 도메인별 미세조정을 진행할 수 있다. 다만 실시간 제약을 고려해 하드웨어 최적화 및 추론 경량화가 병행되어야 한다.
- 실험실 환경에서 고정밀 이중팔 조작 정책 학습을 위한 시뮬레이션 기반 사전학습 피처 소스로 활용 가능하다.
- 로봇 작업 공간의 단안 카메라에서 얻은 RGB-D 관측으로 미래 장면 흐름을 예측해 안전한 접촉 계획 및 회피 판정을 보조할 수 있다.
- 산업용 조립에서 뚜껑 정렬이나 부품 적층처럼 공간 정밀성과 시간 조율이 중요한 작업에 예측 기반 보조 제어기로 적용할 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 색상-깊이 입력(RGB-D)(RGB-D)
- — RGB-D는 각 픽셀에 색상 정보와 단일 뷰로 계산된 깊이 값을 함께 제공하는 입력 형식이다. 깊이 값은 각 픽셀을 3D 카메라 좌표계로 역투영하는 데 사용되어 장면의 기하학적 구조를 복원하게 만든다. 이 논문에서는 단일 RGB-D 관측을 초기 조건으로 삼아 동기화된 RGB, 깊이, 옵티컬 플로우 시퀀스를 생성하는 핵심 조건으로 활용된다.
- 광류(옵티컬 플로우)(Optical Flow)
- — Optical Flow는 연속 프레임 간 픽셀 단위의 2D 이동 벡터를 나타내는 표현이다. 깊이 정보와 결합하면 픽의 시간적 대응을 3D 장면 흐름으로 역투영하여 물체의 실제 공간 이동을 계산할 수 있다. 본 논문은 RGB-DF 구성에서 광류를 명시적으로 생성해 시간적 운동 정보를 3D 장면 흐름으로 해석 가능하게 만들었다.
- 플로우 매칭 손실(Flow Matching)
- — Flow Matching은 데이터와 가우시안 노이즈를 잇는 시간 경로 상에서 노이즈 제어 벡터(velocity field)를 학습하는 확산계열 손실 방식이다. 특정 시점의 노이즈와 목표 데이터 벡터의 차이를 예측하는 회귀 손실 형태로 구현되어 다중 모달리티의 시간 정렬된 복원을 용이하게 만든다. RynnWorld-4D 학습에서 RGB, 깊이, 플로우 분기마다 동일한 노이즈 샘플을 공유해 동기성을 보장하는 데 사용됐다.
- 3차원 Rotary Positional Embedding(3D RoPE)
- — 3D RoPE는 공간적 좌표 정보를 트랜스포머 토큰에 주입하기 위한 회전 기반 위치 인코딩의 3차원 확장이다. 동일한 (u,v) 픽 위치에 대응하는 서로 다른 모달리티 토큰들 간의 공간 정렬을 유지하도록 설계되어 교차 모달 주의에서 기하학적 일관성을 돕는다. 논문에서는 Joint Cross-Modal Attention 내부에서 모달리티 간 픽 단위 정렬을 강제하는 핵심 요소로 적용됐다.
- 역동역학(역운동학) 기반 행동 생성(Inverse Dynamics)
- — Inverse Dynamics는 상태 변화나 예측된 미래 관찰에서 이를 유도하는 행동 시퀀스를 복원하는 문제 설정이다. 본 연구에서는 RynnWorld-4D가 만든 예측형 4D 특징을 입력으로 하여 한 번의 포워드 패스로 행동을 출력하는 정책 헤드 형태로 구현되어 연속 폐쇄 루프 제어에 적합하다. 이 방식은 매 스텝마다 전체 확산 디노이징을 반복하지 않고도 고주파 제어를 가능하게 만든다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.