용어 해설
- 깊이 인식 골격 조건화(Depth-Aware Skeletal Conditioning)
- — 카메라 공간상 깊이 정보를 골격 렌더링의 색과 크기로 인코딩하여 2D 골격에서 3D 상호작용 단서를 보강하는 방법이다. 이 방식은 관찰된 관절의 원근과 가시성 변화를 학습 신호로 전달하여 물체 접촉과 힘 전달 같은 조작 관련 동역학을 더 정확히 재현하게 한다. RynnWorld-Teleop에서는 이 신호를 VAE로 잠재공간에 투사하여 비디오 생성의 제어 조건으로 사용한다.
- 비디오 디퓨전 트랜스포머(Video Diffusion Transformer)
- — 시간 축을 포함한 잠재 또는 픽셀 공간에서 노이즈를 점진적으로 제거하며 프레임을 생성하는 Transformer 기반 비디오 디퓨전 아키텍처다. 노이즈 제거를 위한 denoiser로 Transformer를 사용하여 공간·시간적 문맥을 캡처하고, 조건 입력으로 이미지 또는 골격 잠재를 통합하여 액션 조건 비디오를 합성한다. 본 논문은 이를 기반으로 액션-컨디셔닝 브랜치를 추가하여 로봇 중심의 비디오를 생성한다.
- 자동회귀 증류(Autoregressive Distillation)
- — 비순차(양방향) 교사 모델로부터 순차적(원인적) 학생 모델을 학습시키는 절차로, 학생이 실시간 스트리밍 제약을 만족하도록 구조와 손실을 조정한다. 초기에는 인과적 흐름 일치(causal flow-matching)로 시간적 인과성을 확보한 뒤 분포 정합 단계로 학생의 출력 분포를 교사의 고품질 분포에 근접시킨다. RynnWorld-Teleop은 이 과정을 통해 4스텝 샘플링으로 실시간 생성을 달성했다.
- 인과적 흐름 일치(Causal Flow-Matching)
- — 연속적 노이즈-데이터 경로 상에서 속도장(velocity field)을 인과적 제약 하에 회귀시키는 학습 목표다. 입력 시점 t에서 학생은 과거 프레임 정보만 이용해 속도장을 예측하며, 이를 통해 스트리밍 생성의 안정적 초기화를 제공한다. 논문에서는 이 단계가 없을 경우 분포 정합 단계에서 학습 불안정이 발생한다고 보고했다.
- 청크 기반 재앵커링(Chunked Re-anchoring)
- — 장기간 자동회귀 생성 시 누적된 시각적 드리프트와 물리적 불일치를 줄이기 위해 일정 길이 청크 단위로 실제 참조 프레임을 주기적으로 삽입하는 전략이다. 각 청크 시작에 실제 카메라 프레임을 새로운 레퍼런스로 제공하여 생성 환경의 객체 위치와 조명 등 상태가 누적 오류 없이 유지되게 한다. RynnWorld-Teleop은 81프레임 청크와 재앵커링을 조합하여 장시계열 일관성을 확보했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




