본문으로 건너뛰기

Motion4Motion: 추론 단계에서 피사체 간 모션 전이를 구현하는 학습-프리 프레임워크

Motion4Motion은 소스 비디오에서 픽셀 단위 모션 흐름을 추출해 대상의 키·값 토큰에 위치 정보와 외형 피처를 패딩하는 TransPE로 DiT의 self-attention을 조작하여 학습 없이 상이한 형태의 대상에 고충실도로 모션을 전송한다.

용어 해설

Transferring Positional Encoding(TransPE)
TransPE는 소스 비디오에서 추출한 픽셀 단위 모션 흐름을 대상의 키/값 토큰에 위치 정보와 함께 패딩하여 self-attention 계산이 목표 좌표를 '찾도록' 유도하는 모듈이다. 구체적으로 대상의 appearance 키/값을 복제한 뒤 RoPE에 소스 모션 궤적을 인가해 새로운 K,V를 생성하고 Q는 그대로 유지하여 denoising 단계에서 대상의 피쳐가 전달된 궤적에 합성되도록 한다. 이 방식은 골격 기반 매칭 없이도 서로 다른 형태의 피사체에 모션을 재현할 수 있게 한다.
Rotary Positional Embedding(RoPE)
RoPE는 쿼리와 키 텐서의 일부 차원을 회전시켜 상대적 위치 정보를 주입하는 위치 인코딩 방식이다. 시간·공간 좌표에 따른 회전을 적용하면 인접 토큰들이 attention 계산에서 더 강한 상관성을 가지게 되어 국소 구조와 연속적 모션을 보존하는 데 유리하다. Motion4Motion은 RoPE를 모션 궤적 좌표와 결합해 패딩된 키/값이 지정된 시공간 위치를 가리키게 한다.
Diffusion Transformer
Diffusion Transformer(DiT)는 확산 기반 생성 과정에서 Transformer 블록을 사용해 시공간 토큰 간 상호작용을 모델링하는 아키텍처이다. Motion4Motion은 WAN-T2V 같은 DiT 백본의 self-attention을 조작하여 학습 없이 모션을 주입한다. 이 구조는 latent 공간의 토큰들 사이의 attention 조작으로 시각적 모션 합성을 가능하게 한다.
WAN-T2V
WAN-T2V는 DiT 기반의 텍스트-투-비디오/이미지-투-비디오 모델로, 3D causal VAE로 입력 비디오를 latent로 압축하고 Transformer 블록으로 denoising velocity를 예측한다. Motion4Motion은 WAN-T2V-14B(480p) 백본을 기반으로 TransPE를 적용해 패딩된 키/값을 self-attention에 연결한다. 모델의 latent 해상도와 블록 수가 TransPE 적용 범위를 결정하는 핵심 요소이다.

코드 예제

text
Input: Source video V_src, target subject I_tgt, text prompt c, total steps T, total layers L, begin/end step s_b/s_e, begin/end layer l_b/l_e
Output: Transferred video V_tgt
// Stage 1: Motion Flow Extraction
P_src^1 <- SampleAnchors(V_src[0])
P_tgt <- SemanticMatch(P_src^1, I_tgt)
M_src <- PointTrack(P_src^1, V_src)
M_tgt <- M_src  // via mapping M = I o C^{-1}
// Stage 2: Latent Initialization
V_gen <- Generate(I_tgt, c)
z0 <- Inversion(V_gen)
Cache K_tgt^1, V_tgt^1 from inversion at each layer
// Stage 3: Denoising with TransPE
for t = 0 to T-1 do
  for l = 0 to L-1 do
    Compute Q, K, V from z_t at layer l
    if t < s_e and l_b <= l < l_e then
      K^ <- Repeat(K_tgt^1[P_tgt], F)
      V^ <- Repeat(V_tgt^1[P_tgt], F)
      K_new <- [RoPE(K), RoPE(K^, M_tgt)]
      V_new <- [V, V^]
      X <- Softmax( RoPE(Q) * K_new^T / sqrt(d) ) * V_new
    else
      X <- standard self-attention
    z_{t+1} <- update with velocity prediction
V_tgt <- Decode(z_T)

이 의사코드는 Motion4Motion의 전체 파이프라인을 단계별로 보여준다. 먼저 소스 비디오에서 anchor 포인트를 샘플링하고 대응되는 대상 좌표와 시공간 궤적을 추출한 뒤, 대상 이미지로부터 생성 및 역투영을 통해 초기 latent를 얻어 캐시된 K,V를 준비한다. 이후 denoising 루프에서 지정한 단계와 레이어 범위에 한해 TransPE로 키/값을 패딩하고 RoPE에 모션 궤적을 주입하여 attention을 조작한다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 13.수집 2026. 07. 15.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.