본문으로 건너뛰기

joint-text-visual-planning

공동 텍스트-시각 계획

중급

언어적 계획 구조와 시각적 상태 예측을 하나의 계획 시퀀스로 통합해 각 단계에 대해 텍스트와 이미지(또는 비디오)로 표현된 하위목표와 상태 변화를 동시에 생성하고 정렬하는 접근법이다. 본 논문에서는 영상에서 계획 단계를 자동 분해하고 각 단계에 대응하는 시각적 상태 전이를 정렬해 감독 신호를 구성하는 데 사용되었다. 이 방식은 단일 모델이 이해와 생성 모두에서 계획의 텍스트적·시각적 구성요소를 함께 유지하게 한다.