용어 해설
- 비디오 확산 모델(Video Diffusion)
- — 비디오 확산 모델은 잡음에서 점진적으로 깨끗한 프레임을 복원하는 역확산 과정을 통해 연속 영상 시퀀스를 생성하는 모델이다. 입력으로 현재 프레임과 텍스트나 서브골 같은 조건을 받아 시간적 일관성을 가진 미래 프레임을 샘플링하며, 각 샘플링 단계는 확률적 전이로 해석되어 정책 최적화 신호로 연결될 수 있다. RoboTALES에서는 이러한 비디오 확산의 decoder 특징을 행동 생성기 conditioning으로 활용하여 '행동을 위해 상상'하도록 latent를 조정한다.
- 비전-언어 모델 기반 비평가(VLM Critic)
- — VLM Critic은 생성된 미래 프레임을 목표 지시문과 비교해 언어-시각 일치도를 스칼라 보상으로 산출하는 고정된 모델이다. 이 보상은 확산 샘플링의 각 전이(denoising) 단계를 강화학습 관점에서 다루어 점진적 전이 확률의 로그우도를 정책 신호로 가중할 때 이점을 제공한다. RoboTALES은 이 보상을 DDPO 스타일로 비디오 생성기 내부 표현을 정렬하는 데 사용했다.
- 행동 확산 모델(Action Diffusion)
- — 행동 확산 모델은 전체 행동 시퀀스를 노이즈에서 복원하는 확산(denoising) 과정으로 연속 제어 신호를 생성하는 방법이다. VideoUNet의 decoder 특징을 조건으로 받아 1D UNet 구조에서 행동 노이즈를 제거하며, 예측된 행동은 로봇의 6-DoF 그리퍼 포즈와 그리퍼 상태로 해석된다. 본 논문에서는 행동 확산 손실을 비디오 생성기와 결합해 latent가 제어에 유의미한 정보를 담도록 학습시켰다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.







