본문으로 건너뛰기

RoboTALES: 작업 정렬된 시뮬레이션 미래로 학습하는 추론 기반 로봇 정책

RoboTALES는 LLM 기반 플래너로 단계적 서브골을 생성하고 VLM 비평가 보상을 통해 비디오 생성기의 잠재 표현을 작업 의도에 정렬하여 장기간 조작에서 성공률과 행동 일관성을 향상시켰다.

용어 해설

비디오 확산 모델(Video Diffusion)
비디오 확산 모델은 잡음에서 점진적으로 깨끗한 프레임을 복원하는 역확산 과정을 통해 연속 영상 시퀀스를 생성하는 모델이다. 입력으로 현재 프레임과 텍스트나 서브골 같은 조건을 받아 시간적 일관성을 가진 미래 프레임을 샘플링하며, 각 샘플링 단계는 확률적 전이로 해석되어 정책 최적화 신호로 연결될 수 있다. RoboTALES에서는 이러한 비디오 확산의 decoder 특징을 행동 생성기 conditioning으로 활용하여 '행동을 위해 상상'하도록 latent를 조정한다.
비전-언어 모델 기반 비평가(VLM Critic)
VLM Critic은 생성된 미래 프레임을 목표 지시문과 비교해 언어-시각 일치도를 스칼라 보상으로 산출하는 고정된 모델이다. 이 보상은 확산 샘플링의 각 전이(denoising) 단계를 강화학습 관점에서 다루어 점진적 전이 확률의 로그우도를 정책 신호로 가중할 때 이점을 제공한다. RoboTALES은 이 보상을 DDPO 스타일로 비디오 생성기 내부 표현을 정렬하는 데 사용했다.
행동 확산 모델(Action Diffusion)
행동 확산 모델은 전체 행동 시퀀스를 노이즈에서 복원하는 확산(denoising) 과정으로 연속 제어 신호를 생성하는 방법이다. VideoUNet의 decoder 특징을 조건으로 받아 1D UNet 구조에서 행동 노이즈를 제거하며, 예측된 행동은 로봇의 6-DoF 그리퍼 포즈와 그리퍼 상태로 해석된다. 본 논문에서는 행동 확산 손실을 비디오 생성기와 결합해 latent가 제어에 유의미한 정보를 담도록 학습시켰다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 07.수집 2026. 07. 10.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.