본문으로 건너뛰기

tactile-foresight

촉각 예측(포사이트)

모델이 미래의 촉각 잠재(latent)를 예측하도록 하는 설계로, 비디오와 동일한 VAE 잠재 공간에서 촉각을 공동 생성한다. 논문은 촉각을 잔차(residual) 형태 Δ^t_i로 예측해 접촉 발생과 해제 시의 변화량을 포착한다. 이 예측은 액션 생성 이전에 공유 self-attention으로 함께 denoise되어 행동의 조건으로 사용된다.