추론-후-렌더링 패러다임
현재 프레임과 텍스트 의도를 입력으로 물리 언어 시퀀스를 먼저 생성하고, 그 시퀀스를 조건으로 미리학습된 확산 디코더가 영상을 생성하는 처리 흐름입니다. 상태 전이 추론과 픽셀 합성을 분리하여 동적 구조를 명시적으로 모델링하도록 유도합니다. 이렇게 하면 동역학 추론의 정확도가 픽셀생성의 시각적 품질과 별도로 향상될 가능성이 커집니다.