Transferring Positional Encoding
TransPE는 소스 비디오에서 추출한 픽셀 단위 모션 흐름을 대상의 키/값 토큰에 위치 정보와 함께 패딩하여 self-attention 계산이 목표 좌표를 '찾도록' 유도하는 모듈이다. 구체적으로 대상의 appearance 키/값을 복제한 뒤 RoPE에 소스 모션 궤적을 인가해 새로운 K,V를 생성하고 Q는 그대로 유지하여 denoising 단계에서 대상의 피쳐가 전달된 궤적에 합성되도록 한다. 이 방식은 골격 기반 매칭 없이도 서로 다른 형태의 피사체에 모션을 재현할 수 있게 한다.