전체 접근 및 핵심 아이디어: TryOnCrafter는 두 단계로 구성된다. 첫째, 4D Try-on Proxy Construction은 소스 비디오에서 깊이·카메라 파라미터를 추정해 전역 포인트 클라우드를 구성하고, SMPL-X 시퀀스와 앵커 기반 정렬을 통해 파라메트릭 아바타를 metric-aligned world space로 위치시킨다. 둘째, Proxy-Anchored Video Generation은 렌더된 프록시 시퀀스를 DiT에 주입하고 CRA와 멀티모달 조건화를 결합해 최종 비디오를 합성한다.
Scene reconstruction 및 Anchor-based Alignment: 입력으로는 각 시각 t에서의 깊이 D_t, 깊이 신뢰도 W_t, 카메라 파라미터 {K_t,R_t,t_t}가 있다. 이들로 back-projected 전역 포인트 클라우드 P가 생성되며 SAM 2로 사람/배경 성분(P^h, P^b)을 분리한다. SMPL-X 시퀀스 {Θ_t}는 로컬 카메라 공간 S^c에서 계산되므로, 유사변환 T(v)=s_t R_t v + t_t를 최적화해 SMPL-X 정점 V_t^{smpl}을 세계공간 S^w로 매핑한다. 최적화 목적식: 입력은 관측점 p_i와 SMPL-X 정점 집합 V_t^{smpl}이며, 연산은 각 p_i에 대해 min_{v in V_t^{smpl}} || s_t R_t v + t_t − p_i ||^2에 깊이/경계 기반 weight w_i를 곱해 합산하고 이를 s_t,R_t,t_t에 대해 최소화한다. 결과는 metric-aligned 파라메트릭 시퀀스로, 의미는 프록시와 배경의 스케일·좌표 불일치 제거이다.
Canonical 3DGS 아바타 생성 및 변형: 키프레임 I_{t*}에서 생성한 2D try-on 이미지 Ĩ_{t*}을 avatar foundation model에 입력해 canonical 3DGS avatar G_c를 얻는다. 각 gaussian primitive는 (x_i, Σ_i, σ_i, c_i)로 정의되며 canonical A-pose Θ_c에 앵커된다. 변형 단계에서는 LBS를 이용해 primitive 위치·공분산을 pose별로 변형: 연산 순서 — [입력: primitive의 canonical 위치 x_c와 스킨닝 가중치 w_j, 골격 변환 T_j,R'_j] → [연산: ∑_j w_j T_j x_c로 포즈 공간 좌표 계산 → 유사변환 T로 world space로 매핑] → [결과: world-space x와 Σ] → [의미: 프레임 단위로 세부 텍스처·형상 보존].
렌더링 및 DiT 조건화: posed avatar G_p는 3DGS rasterizer로 렌더되고 배경 P^b는 point-based renderer로 처리되어 렌더된 비디오 V_render를 생성한다. 이 V_render와 binary mask는 Wan Encoder로 인코딩되어 DiT의 patchify 단계에서 노이즈 latent와 채널 차원으로 결합된다. CRA 모듈은 DiT feature F_i와 reference feature F_l 사이에 weight-sharing attention을 적용: K and V projection weights(W_K,W_V)는 backbone과 공유되고 Q'와 O'는 독립적으로 학습된다. 연산은 sg(F_i)W_Q' · (F_l W_K)^T / sqrt(d) → Softmax → (F_l W_V) · W_O'로 reference residual O_l'를 얻고, 이를 Attn(F_i, ...)의 출력에 additive residual로 통합한다.
멀티모달 조건화 및 학습 파이프라인: CLIP 이미지 인코더로 garment feature f_gar와 UmT5 텍스트 인코더로 attribute token f_text를 추출해 DiT 블록의 cross-attention에 주입한다. 학습은 Wan2.1-I2V-14B 사전학습 모델을 기반으로 progressive two-stage training을 사용하고, 구현에는 16×NVIDIA A100(80GB)를 사용했다. 추론은 20 denoising steps와 CFG scale=6.0을 사용한다.