TL;DR
로봇 학습에 필요한 대규모 다변화된 궤적 수집은 물리적 원격조작에서 운영·하드웨어 제한에 의해 병목이 발생했다. 본 연구는 실제 로봇 대신 행동-조건형 생성 세계 모델을 사용해 조작자의 손 포즈를 실시간으로 로봇 관점의 실행 영상과 정렬된 관절 행동으로 변환함으로써 운영 제약을 제거했다. 이런 접근은 데이터 수집 속도를 조작자의 상상력으로 확장하고, 합성 데이터로 학습한 정책이 실제 환경에서 제로샷으로 동작하는 근거를 제공했다.
왜 중요한가
로봇 학습에 필요한 대규모 다변화된 궤적 수집은 물리적 원격조작에서 운영·하드웨어 제한에 의해 병목이 발생했다. 본 연구는 실제 로봇 대신 행동-조건형 생성 세계 모델을 사용해 조작자의 손 포즈를 실시간으로 로봇 관점의 실행 영상과 정렬된 관절 행동으로 변환함으로써 운영 제약을 제거했다. 이런 접근은 데이터 수집 속도를 조작자의 상상력으로 확장하고, 합성 데이터로 학습한 정책이 실제 환경에서 제로샷으로 동작하는 근거를 제공했다.
핵심 기여
디지털 텔레오퍼레이션 패러다임 정형화
디지털 텔레오퍼레이션을 연산적으로 정의하고 실용적 요건을 규정했다. 이 요건은 로봇 중심성, 행동-연결성, 실시간성으로 구성되어 있으며 이러한 세 가지를 모두 만족하는 시스템이 기존에는 존재하지 않았음을 문서화했다. 논문은 이 규칙을 기반으로 전체 파이프라인 설계 목표를 수립했다.
Depth-aware 골격 표현과 분포 정렬 제어 융합
21관절 골격을 깊이에 따라 색과 직경으로 렌더링하여 2D 입력에 3D 단서를 주입했다. 골격 비디오를 VAE로 잠재화한 뒤 비디오 잠재와 통계적으로 정렬된 패치 임베딩을 통해 additive 방식으로 통합함으로써 사전학습된 DiT의 분포를 유지하면서 동작 제어 신호를 안정적으로 도입했다. 이 설계는 결합 초기값을 제로로 두고 게이팅 스칼라로 점진 도입하는 방식으로 학습 안정성을 확보했다.
사전학습-적응-증류의 점진 학습 파이프라인
대규모 인간 시점 비디오로 사전학습을 수행하여 조작 사전지식을 흡수한 뒤, 인간-로봇 페어 데이터로 파인튜닝하여 기구학적 차이를 좁혔다. 이어서 양방향 교사 모델을 인과적 학생 모델로 연속 증류하여 실시간 스트리밍 생성이 가능하도록 했다. 이 계층적 과정은 데이터 부족 상황에서도 물체 영속성 및 상호작용 물리성의 보존에 필수적임이 실험적으로 확인됐다.
스트리밍 자동회귀 증류로 40+ FPS 실시간 생성 달성
교사 모델의 고품질 분포를 학생에게 전이하기 위해 인과적 흐름 일치로 초기화한 뒤 분포 정합 증류(DMD)를 적용했다. 학생 모델은 고정 크기 KV 캐시와 인과적 마스크를 사용해 시간적 상태를 유지하면서 4단계 샘플링으로 480×832 해상도에서 약 40.0 FPS를 달성했다. 이 성능은 실시간 제어 루프에 필요한 감지-행동 지연을 실용적 수준으로 낮췄다.
디지털 생성 데이터로 학습한 정책의 제로샷 Sim2Real 성능 검증
RynnWorld-Teleop가 생성한 합성 데이터만으로 학습한 정책이 복잡한 양수 대응 조작 과제에서 실환경으로 제로샷 전이 가능한 점을 보였다. 또한 기존 실데이터에 합성 데이터를 덧붙이면 성공률이 일관되게 향상되었으며, 특히 고정밀 과제에서 최대 20%p 수준의 개선이 관찰됐다. 이는 합성 데이터가 단순한 시각적 보강을 넘어 물리적 상호작용 정보를 보존함을 시사한다.
핵심 아이디어 이해하기
문제 출발점과 기존 한계에 대한 정의는 다음과 같다. 로봇 조작 정책 학습에는 대규모의 다양한 상태-행동 궤적이 필요하지만 물리적 원격조작은 하드웨어와 작업공간에 데모가 결속되어 있어 수집량이 연산적으로 제한된다. 기존 인간-대-로봇 변환 또는 액션-조건형 세계 모델은 시각적 품질이나 액션 제공 중 하나만 제공하거나 실시간 상호작용을 지원하지 못해 데이터 엔진으로서의 요구를 충족하지 못했다. 이러한 한계는 대규모 일반화와 장시계열 일관성을 가진 로봇 학습 데이터 생산을 가로막았다. 이 논문의 해결 원리는 세 가지 축에서 작동한다. 첫째, 인간 손 포즈 스트림을 깊이 인식 골격으로 렌더링하여 2D 입력에 깊이·가시성 단서를 추가하고 이를 VAE로 잠재화해 제어 조건으로 사용했다. 둘째, 사전학습된 Video Diffusion Transformer 기반 생성기 위에 제어 패치 임베딩을 병렬로 추가하고 분포 정렬(additive fusion)로 결합하여 사전 가중치의 분포를 파괴하지 않고 동작 신호를 통합했다. 셋째, 양방향 교사를 인과적 학생으로 증류하는 단계적 절차로 스트리밍 성능을 확보하여 실시간 제어 루프에 투입 가능한 생성 속도를 실현했다. 이 접근이 가능하게 하는 변화는 구체적이다. 분포 정렬과 깊이 인식 골격으로 행동-시각 정합성을 강화함으로써 생성된 데이터는 단순한 시각적 유사성을 넘어 행동과 연속적으로 정렬된 상태-행동 쌍을 생산하게 되었다. 점진적 사전학습-로봇 적응-증류 파이프라인은 제한된 로봇 데이터로도 물리적 상호작용의 유의미한 prior를 전이시키며, 결과적으로 합성 데이터만으로도 일부 과제에서 제로샷 전이가 가능해졌다. 또한 인과적 학생의 4-step 샘플링은 실시간 제어 주파수(약 40 FPS)를 확보하여 생성기와 실제 로봇 제어의 시간적 요구를 맞추었다.
방법론
전체 접근 방식은 입력 손 포즈 스트림과 단일 참조 이미지로부터 로봇 관점의 실행 비디오와 동기화된 로봇 행동 벡터를 생성하는 파이프라인으로 구성된다. 입력 손 포즈는 21관절로 표현되어 깊이 기반 색상과 직경으로 렌더링된 골격 비디오로 변환되며, 이 골격 비디오는 미리 학습된 VAE 인코더를 통해 비디오 잠재와 동일한 차원·시간·공간 구조의 제어 잠재로 투사된다. 참조 이미지는 장면의 시각적 정체성을 유지하는 정적 조건으로서 잠재로 인코딩되어 생성 초기 상태의 관성 역할을 수행한다. 핵심 메커니즘은 분포 정렬을 통한 제어 융합과 자동회귀 증류에 있다. 제어 잠재는 비디오 잠재의 평균과 표준편차에 맞추어 정규화된 뒤 제로 초기화된 제어 패치 임베딩과 게이팅 스칼라를 통해 더해진다. 이 additive scheme은 사전학습된 DiT의 분포를 보존하면서 제어 신호의 점진적 도입을 허용하여 미세 조작 제어를 학습 가능하게 했다. 증류 단계는 먼저 인과적 흐름 일치로 학생을 시간적 인과성에 맞춰 초기화한 뒤 Distribution Matching Distillation(DMD)을 적용하여 소수의 denoising 스텝으로 교사 분포를 근사하게 했다. 학습 전략은 두 단계의 도메인 전이로 설계되었다. Stage 1에서는 EgoDex와 VITRA 같은 대규모 인간 시점 데이터로 DiT를 사전학습하여 조작 사전지식을 흡수했고 Stage 2에서는 1,800개의 인간-로봇 페어 에피소드로 파인튜닝하여 기구학적 격차를 줄였다. 파인튜닝은 LoRA 기반 저랭크 어댑테이션과 전체 파라미터 SFT를 모두 실험하여 학습 효율과 품질의 절충을 검토했고 결국 분포 정렬된 제어 브랜치를 함께 학습함으로써 로봇 중심의 출력 생성을 확보했다.
관련 Figure

상단은 조작자가 실제 로봇을 직접 제어해 RGB 관찰과 로봇 행동이 동시에 기록되는 전통적 흐름을 나타내며 하드웨어 종속성·작업공간 제약·수동 리셋의 병목을 강조한다. 하단은 RynnWorld-Teleop 기반 디지털 텔레오퍼레이션을 보이며 손 포즈 스트림을 깊이 인식 골격으로 변환하고 생성된 비디오와 리타게팅된 로봇 행동을 동기화해 데이터 쌍을 생성하는 과정을 보여준다. 이 도식은 본 논문이 제안한 패러다임의 구성요소와 설계 목표인 실시간성·하드웨어 무관성·자산 오버헤드 제거를 직관적으로 요약한다.
물리적 원격조작과 디지털 원격조작의 전체 파이프라인을 비교한 도식이다.

좌측은 제어와 비디오 잠재를 단순 연결한 결과로 텍스처 뭉침과 제어 불안정이 관찰되며 우측은 분포 정렬된 additive 융합의 결과로 보다 선명하고 제어 응답성이 유지되는 모습이 나타난다. 이 비교는 Table의 정량적 Ablation 결과(FVD 증가 등)와 일관되며 분포 정렬 방식의 분포 유지 및 학습 안정성 확보 효과를 뒷받침한다. 따라서 본 논문의 제어 융합 설계가 사전학습된 생성기와의 호환성을 유지한다는 기술적 근거를 제공한다.
Concatenation과 Addition(분포 정렬된 가감) 융합 전략의 정성적 비교 예시를 제시한 이미지이다.
주요 결과
주요 성능 평가는 생성 품질(PSNR, SSIM, LPIPS, FVD), 실시간 처리률(FPS), 그리고 생성 데이터로 학습한 정책의 실세계 성공률로 이루어졌다. 생성 성능표에서 RynnWorld-Teleop(LoRA)는 EgoDex-Test에서 PSNR 26.08, SSIM 0.876, LPIPS 0.151, FVD 585를 달성하여 일반 목적 I2V 모델과 기존 액션-조건형 모델 대비 의미 있는 개선을 보였다. 인과적 학생 모델은 실시간성 측정에서 480×832 해상도 기준 약 40.0 FPS, 프레임당 평균 지연 약 25 ms를 달성하여 제어 루프 요구를 만족했다. 정책 학습 실험에서는 세 가지 정책 기반에 합성 데이터를 300 에피소드씩 추가하는 실험을 수행했고 대부분의 과제에서 성공률이 증가했다. 특히 정밀도가 요구되는 Lid Placement 과제에서 π0.5의 성공률이 42.86%에서 62.86%로, π0은 34.29%에서 54.29%로 각각 약 20%p 향상했다. 합성 데이터만으로 학습한 π0 모델은 Block Pushing에서 82.86%, Bimanual Lifting에서 77.14%의 성공률을 보여 제로-리얼 데이터 시나리오에서도 경쟁력 있는 성능을 나타냈다. 추가 분석으로 t-SNE 기반 특징 분포 시각화에서는 RynnWorld-Teleop 생성 데이터와 실제 데이터의 고수준 임베딩이 상당한 중첩을 보여 시각·의미적 분포 정합이 확보되었음을 확인했다. 또한 제거 실험에서 인간 사전학습을 생략하면 FVD가 크게 악화되고 시각적 품질 붕괴가 발생하여 점진적 학습이 필수임이 검증되었다.
관련 Figure

이미지는 동일한 손 포즈 스트림이 깊이 인식 골격으로 렌더링된 뒤 서로 다른 참조 장면에서 어떻게 시각적 실행으로 매핑되는지를 보여준다. 사람 관찰 프레임과 로봇 관점 프레임이 함께 제시되어 행동-시각 정합성 및 본 논문의 인간-로봇 도메인 적응 특성을 시각적으로 확인하게 한다. 이러한 시퀀스는 사전학습된 인간 데이터로부터 얻은 조작 prior가 로봇 특정 영상으로 전이되는 근거를 제공한다.
깊이 인식 골격 표현과 다양한 작업에서 생성된 인물 및 로봇 관점의 프레임 예시를 병렬로 배열한 이미지이다.

여러 행에 걸쳐 각기 다른 작업(예: 블록 밀기, 물건 들기 등)의 시퀀스가 배치되어 시계열 일관성, 물체 상호작용, 손-물체 접촉의 재현성을 동시에 관찰할 수 있다. 이 정성 결과는 장시계열 생성에서의 드리프트 완화 전략과 청크 기반 재앵커링의 유효성을 시각적으로 뒷받침한다. 또한 인간 사전학습이 있을 때와 없을 때의 품질 차이를 비교할 때의 근거 이미지로 활용된다.
다양한 작업과 시점에서의 연속 프레임 샘플을 모아 놓은 정성적 결과 모음이다.

이 그림은 실제 로봇 환경에서 생성된 프레임과 대응 제어 골격이 어떻게 정렬되는지를 보여주며 특히 물체 조작의 시각적 디테일과 접촉 순간의 재현성을 강조한다. 로봇-특정 테스트셋에서의 품질 지표(PSNR, SSIM, LPIPS, FVD)와 연결되어 합성 데이터의 물리적 타당성을 시각적으로 보강한다. 또한 다양한 초기 상태 랜덤화 하에서의 일반화 능력을 직관적으로 확인할 수 있게 한다.
로봇별 태스크에 대한 연속 프레임과 대응하는 골격 렌더링 샘플을 보여주는 정성적 예시 모음이다.
기술 상세
전체 아키텍처는 3D VAE 인코더·디코더와 Transformer 기반의 Video Diffusion Transformer(DiT)로 구성되며 입력으로 참조 이미지 잠재와 제어 잠재를 받는다. 깊이 인식 골격은 21관절의 2D 렌더링으로 만들어져 색과 직경으로 깊이 신호를 인코딩하고 이를 VAE로 잠재화하여 시간·공간 정렬된 제어 텐서를 생성한다. 제어 브랜치는 독립적 PatchEmbed로 구현되며 정규화된 제어 잠재를 비디오 잠재 분포에 맞추어 가감함으로써 분포 혼란을 방지한다. 수학적 학습 목적은 conditional flow matching 프레임워크에 기반하며 노이즈-데이터 경로 상의 속도장 예측을 목표로 한다. 교사 모델은 양방향 디퓨전 과정을 통해 고품질 출력을 생성하고 학생 모델은 인과적 마스크와 KV 캐시를 사용하는 스트리밍 구조로 재구성된다. 학생 학습은 먼저 인과적 흐름 일치 손실로 속도장 회귀를 안정화시키고 그 다음 Distribution Matching Distillation을 통해 소수 스텝 샘플링으로 교사 분포를 근사하도록 미세 조정한다. 구현 및 학습 세부사항은 대규모 자원과 최적화를 포함한다. 사전학습 및 파인튜닝은 Wan-2.2-TI2V-5B 기반으로 64개의 NVIDIA H100 GPU에서 총 2,000 스텝 이상의 파인튜닝을 거쳤고 LoRA(rank 64)와 전체 파라미터 SFT를 병행 실험했다. 실시간 학생은 4-스텝 샘플링과 DMD 정제, 고정 크기 KV 캐시를 사용해 480×832 해상도에서 약 40 FPS 처리를 달성했다.
한계점
논문에서 명시한 한계는 복잡한 유체 역학이나 고도로 변형 가능한 물체 조작에서 모델이 여전히 성능 저하를 보인다는 점이다. 현재 접근법은 플랫폼별 파인튜닝을 필요로 하여 로봇 함대 전반에 대한 즉시적 확장성에 제약이 존재한다. 이러한 한계를 극복하려면 더 풍부한 상호작용 데이터와 로봇 기구학 기술자를 조건으로 하는 범용적 세계 모델 연구가 요구된다.
실무 활용
RynnWorld-Teleop는 실제 로봇을 움직이지 않고도 대규모 행동-관찰 데이터셋을 생성하여 모방 학습 파이프라인의 확장에 즉시 활용될 수 있다. 단일 참조 이미지로 장면을 인스턴스화할 수 있어 물리적 자산 구축 비용을 크게 줄이며 기존 실데이터와의 혼합 학습으로 성능을 향상시켰다. 실시간 생성 성능은 원격 조작 인터랙션과 데이터 수집의 동시성을 보장한다.
- 현장 데이터 수집이 제한된 환경에서 인간 조작자로부터 대규모 합성 트레이닝 데이터 생성
- 로봇 폴리시의 데이터 증강을 통해 정밀 조작 과제의 성공률 개선
- 다양한 시각 상태와 객체 변형에 대한 일반화 실험을 위한 빠른 장면 인스턴스화
- 원격 조작 인터페이스로서 실시간 합성 비디오를 사용한 원격 교육 및 디버깅
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Depth-Aware Skeletal Conditioning
- — 카메라 공간상 깊이 정보를 골격 렌더링의 색과 크기로 인코딩하여 2D 골격에서 3D 상호작용 단서를 보강하는 방법이다. 이 방식은 관찰된 관절의 원근과 가시성 변화를 학습 신호로 전달하여 물체 접촉과 힘 전달 같은 조작 관련 동역학을 더 정확히 재현하게 한다. RynnWorld-Teleop에서는 이 신호를 VAE로 잠재공간에 투사하여 비디오 생성의 제어 조건으로 사용한다.
- Video Diffusion Transformer
- — 시간 축을 포함한 잠재 또는 픽셀 공간에서 노이즈를 점진적으로 제거하며 프레임을 생성하는 Transformer 기반 비디오 디퓨전 아키텍처다. 노이즈 제거를 위한 denoiser로 Transformer를 사용하여 공간·시간적 문맥을 캡처하고, 조건 입력으로 이미지 또는 골격 잠재를 통합하여 액션 조건 비디오를 합성한다. 본 논문은 이를 기반으로 액션-컨디셔닝 브랜치를 추가하여 로봇 중심의 비디오를 생성한다.
- Autoregressive Distillation
- — 비순차(양방향) 교사 모델로부터 순차적(원인적) 학생 모델을 학습시키는 절차로, 학생이 실시간 스트리밍 제약을 만족하도록 구조와 손실을 조정한다. 초기에는 인과적 흐름 일치(causal flow-matching)로 시간적 인과성을 확보한 뒤 분포 정합 단계로 학생의 출력 분포를 교사의 고품질 분포에 근접시킨다. RynnWorld-Teleop은 이 과정을 통해 4스텝 샘플링으로 실시간 생성을 달성했다.
- Causal Flow-Matching
- — 연속적 노이즈-데이터 경로 상에서 속도장(velocity field)을 인과적 제약 하에 회귀시키는 학습 목표다. 입력 시점 t에서 학생은 과거 프레임 정보만 이용해 속도장을 예측하며, 이를 통해 스트리밍 생성의 안정적 초기화를 제공한다. 논문에서는 이 단계가 없을 경우 분포 정합 단계에서 학습 불안정이 발생한다고 보고했다.
- Chunked Re-anchoring
- — 장기간 자동회귀 생성 시 누적된 시각적 드리프트와 물리적 불일치를 줄이기 위해 일정 길이 청크 단위로 실제 참조 프레임을 주기적으로 삽입하는 전략이다. 각 청크 시작에 실제 카메라 프레임을 새로운 레퍼런스로 제공하여 생성 환경의 객체 위치와 조명 등 상태가 누적 오류 없이 유지되게 한다. RynnWorld-Teleop은 81프레임 청크와 재앵커링을 조합하여 장시계열 일관성을 확보했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.