WAN-T2V
WAN-T2V는 DiT 기반의 텍스트-투-비디오/이미지-투-비디오 모델로, 3D causal VAE로 입력 비디오를 latent로 압축하고 Transformer 블록으로 denoising velocity를 예측한다. Motion4Motion은 WAN-T2V-14B(480p) 백본을 기반으로 TransPE를 적용해 패딩된 키/값을 self-attention에 연결한다. 모델의 latent 해상도와 블록 수가 TransPE 적용 범위를 결정하는 핵심 요소이다.