TL;DR
사용자가 임의의 시점으로 옷을 회전·확인하는 실무적 요구를 기존 VVT는 입력 비디오의 고정 카메라 궤적에 의존해 충족하지 못한다. TryOnCrafter는 인간과 배경을 분리한 렌더 가능한 4D 프록시를 기반으로 DiT를 구동해 임의 카메라 궤적에서도 텍스처·구조·동작 일관성을 유지하는 카메라-컨트롤러블 비디오 가상 피팅을 실현한다.
왜 중요한가
사용자가 임의의 시점으로 옷을 회전·확인하는 실무적 요구를 기존 VVT는 입력 비디오의 고정 카메라 궤적에 의존해 충족하지 못한다. TryOnCrafter는 인간과 배경을 분리한 렌더 가능한 4D 프록시를 기반으로 DiT를 구동해 임의 카메라 궤적에서도 텍스처·구조·동작 일관성을 유지하는 카메라-컨트롤러블 비디오 가상 피팅을 실현한다.
핵심 기여
CaM-VVT 문제 정의 및 벤치마크(CaM-VVTBench)
Camera-controllable Video Virtual Try-on(CaM-VVT) 문제를 공식화하고, 다양한 카메라 프리미티브(tilt/zoom/orbit)를 포함하는 CaM-VVTBench(약 60K 학습 클립, 96개 테스트 샘플)를 구축해 통제된 평가 기준을 제공한다.
Renderable 4D Try-on Proxy
원본 동영상에서 복원한 동적 포인트 클라우드와 SMPL-X 시퀀스를 앵커로 사용해, 2D try-on priors를 3DGS 기반의 canonical avatar로 증류하고 LBS로 구동해 시간·공간 정렬된 4D 표현을 만든다. 이 프록시는 인간과 배경을 분리하여 임의 카메라 궤적에서 일관된 구조·텍스처를 제공한다.
Proxy-Anchored Video DiT + CRA + 멀티모달 조건화
렌더된 프록시 시퀀스를 DiT의 픽셀-정렬된 구조적 prior로 주입하고, Cross-view Reference Adapter(CRA)를 통해 DiT의 K/V를 공유하되 Q'/O'를 독립적으로 사용해 참조 도메인의 세부 정합을 도입한다. 또한 CLIP 이미지와 UmT5 텍스트 임베딩을 결합해 뷰 간 정체성·재질 보존을 강화한다.
엔드-투-엔드 DiT 기반 통합 파이프라인
기존의 두 단계(VVT → V2V) 방식과 달리, 4D 프록시로 구조를 고정한 상태에서 DiT로 직접 합성해 오류 누적을 완화하고 계산 효율성을 확보한다. Wan2.1-I2V-14B 기반의 progressive two-stage 학습을 사용해 실험적으로 SOTA 성능을 달성했다.
핵심 아이디어 이해하기
문제 출발점과 기존 한계: Video Virtual Try-on(VVT)은 목표 의상(texture)을 동적 인물 비디오에 일관되게 합성하는 작업이다. 기존 VVT는 입력 비디오의 카메라 경로에 종속되어 있어 사용자가 새로운 시점으로 자유롭게 회전해 의상 뒷면·측면을 관찰하려는 요구를 충족하지 못한다. 또한, 단순한 포인트 클라우드나 픽셀-기반 조작은 극단적 시점 전환에서 구조 붕괴, 텍스처 누락, 배경과의 기하학적 불일치를 초래한다.
해결 원리: 본 논문은 인간(subject)과 배경(environment)을 명시적으로 분리한 'Renderable 4D Try-on Proxy'를 도입한다. 구체적으로, 소스 비디오에서 얻은 동적 포인트 클라우드(배경)와 SMPL-X 시퀀스(로컬 카메라 공간)를 앵커로 삼아 SMPL-X 정점들을 세계 좌표계로 매핑하는 유사변환(s_t, R_t, t_t)을 최적화한다. 이 최적화는 [입력: 포인트 클라우드의 관측점 p_i와 SMPL-X 정점 집합 V_t^{smpl}] → [연산: 각 관측점과 가장 근접한 SMPL-X 정점까지의 거리의 가중합(깊이 신뢰도·경계 근접도 기반 weight w_i)를 계산하고 s_t,R_t,t_t를 최소화] → [결과: metric-aligned SMPL-X 시퀀스] → [의미: 파라메트릭 아바타가 배경과 같은 스케일·좌표계에 정렬되어 시간적·공간적 일관성 확보].
구현적 핵심: 2D 기반 고품질 try-on 결과를 이미지-아바타 foundation model을 통해 canonical 3DGS avatar로 증류한다. 각 Gaussian primitive는 위치 x_i, 공분산 Σ_i, 투명도 σ_i, 색상 c_i를 포함하며, canonical A-pose에서 SMPL-X에 anchoring된다. 이후 Linear Blend Skinning(LBS)을 통해 각 프레임의 SMPL-X pose로 primitive를 변형해 posed avatar를 얻는다. 이 posed avatar와 배경 포인트 클라우드는 hybrid renderer(3DGS rasterizer + point renderer)로 픽셀-정렬된 렌더 영상을 생성하며, 이 렌더를 DiT의 구조적 prior로 주입해 합성 안정성을 높인다.
달라지는 점 및 효과: 렌더된 4D 프록시는 DiT의 생성 과정을 강하게 제약해 시점-무관(texture hallucination) 텍스처 보존과 물리적 일관성이 확보된다. 추가적으로 CRA 모듈은 DiT의 K/V를 공유하고 Q'/O'를 분리해 참조 도메인의 세부 신호를 low-overhead 방식으로 도입함으로써 ID 보존과 배경 정합을 개선한다. 결과적으로 ViViD와 CaM-VVTBench에서 VFID·SSIM·LPIPS 및 CaM-VVTBench의 Overall Score 기준으로 기존 방법을 능가했다.
방법론
전체 접근 및 핵심 아이디어: TryOnCrafter는 두 단계로 구성된다. 첫째, 4D Try-on Proxy Construction은 소스 비디오에서 깊이·카메라 파라미터를 추정해 전역 포인트 클라우드를 구성하고, SMPL-X 시퀀스와 앵커 기반 정렬을 통해 파라메트릭 아바타를 metric-aligned world space로 위치시킨다. 둘째, Proxy-Anchored Video Generation은 렌더된 프록시 시퀀스를 DiT에 주입하고 CRA와 멀티모달 조건화를 결합해 최종 비디오를 합성한다.
Scene reconstruction 및 Anchor-based Alignment: 입력으로는 각 시각 t에서의 깊이 D_t, 깊이 신뢰도 W_t, 카메라 파라미터 {K_t,R_t,t_t}가 있다. 이들로 back-projected 전역 포인트 클라우드 P가 생성되며 SAM 2로 사람/배경 성분(P^h, P^b)을 분리한다. SMPL-X 시퀀스 {Θ_t}는 로컬 카메라 공간 S^c에서 계산되므로, 유사변환 T(v)=s_t R_t v + t_t를 최적화해 SMPL-X 정점 V_t^{smpl}을 세계공간 S^w로 매핑한다. 최적화 목적식: 입력은 관측점 p_i와 SMPL-X 정점 집합 V_t^{smpl}이며, 연산은 각 p_i에 대해 min_{v in V_t^{smpl}} || s_t R_t v + t_t − p_i ||^2에 깊이/경계 기반 weight w_i를 곱해 합산하고 이를 s_t,R_t,t_t에 대해 최소화한다. 결과는 metric-aligned 파라메트릭 시퀀스로, 의미는 프록시와 배경의 스케일·좌표 불일치 제거이다.
Canonical 3DGS 아바타 생성 및 변형: 키프레임 I_{t*}에서 생성한 2D try-on 이미지 Ĩ_{t*}을 avatar foundation model에 입력해 canonical 3DGS avatar G_c를 얻는다. 각 gaussian primitive는 (x_i, Σ_i, σ_i, c_i)로 정의되며 canonical A-pose Θ_c에 앵커된다. 변형 단계에서는 LBS를 이용해 primitive 위치·공분산을 pose별로 변형: 연산 순서 — [입력: primitive의 canonical 위치 x_c와 스킨닝 가중치 w_j, 골격 변환 T_j,R'_j] → [연산: ∑_j w_j T_j x_c로 포즈 공간 좌표 계산 → 유사변환 T로 world space로 매핑] → [결과: world-space x와 Σ] → [의미: 프레임 단위로 세부 텍스처·형상 보존].
렌더링 및 DiT 조건화: posed avatar G_p는 3DGS rasterizer로 렌더되고 배경 P^b는 point-based renderer로 처리되어 렌더된 비디오 V_render를 생성한다. 이 V_render와 binary mask는 Wan Encoder로 인코딩되어 DiT의 patchify 단계에서 노이즈 latent와 채널 차원으로 결합된다. CRA 모듈은 DiT feature F_i와 reference feature F_l 사이에 weight-sharing attention을 적용: K and V projection weights(W_K,W_V)는 backbone과 공유되고 Q'와 O'는 독립적으로 학습된다. 연산은 sg(F_i)W_Q' · (F_l W_K)^T / sqrt(d) → Softmax → (F_l W_V) · W_O'로 reference residual O_l'를 얻고, 이를 Attn(F_i, ...)의 출력에 additive residual로 통합한다.
멀티모달 조건화 및 학습 파이프라인: CLIP 이미지 인코더로 garment feature f_gar와 UmT5 텍스트 인코더로 attribute token f_text를 추출해 DiT 블록의 cross-attention에 주입한다. 학습은 Wan2.1-I2V-14B 사전학습 모델을 기반으로 progressive two-stage training을 사용하고, 구현에는 16×NVIDIA A100(80GB)를 사용했다. 추론은 20 denoising steps와 CFG scale=6.0을 사용한다.
관련 Figure

이 다이어그램은 입력 비디오에서 깊이·카메라를 추정해 포인트 클라우드와 SMPL-X를 정렬하는 과정, canonical avatar 증류, LBS 기반 변형, 그리고 Wan Encoder/DiT/CRA/멀티모달 조건화가 어떻게 연결되는지를 명확히 나타낸다. 아키텍처 블록별 역할(구조적 prior, 참조 보강, 텍스트·이미지 조건화)을 이해하는 데 핵심적이다.
전체 파이프라인 다이어그램: 4D Try-on Proxy 구성(장면 복원, 앵커 정렬, 3DGS 아바타 생성)과 Proxy-Anchored Video DiT의 모듈 연결을 보여준다.
주요 결과
메인 벤치마크(ViViD): 표 1의 수치 기준으로 TryOnCrafter는 paired 및 unpaired 설정에서 최저 VFID를 달성했다. 주요 수치: VFID_I^p=9.6085, VFID_R^p=0.1817, VFID_I^u=10.7563, VFID_R^u=0.2088, SSIM=0.8675, LPIPS=0.0567. 이는 기존 최상위 방법들(CatV2TON, Magic-Tryon, DreamVVT 등)보다 전반적 영상 충실도와 지각적 유사도에서 우수함을 의미한다.
CaM-VVTBench 평가: 표 3 기준으로 TryOnCrafter는 Overall Score=75.47, Subject Consistency=92.71, Imaging Quality=74.28을 기록해 두-단계(try-on + trajectory) 결합 방식들을 능가했다. 두-단계 조합은 카메라 조작에서 구조적 붕괴와 텍스처 누락이 증가했으나 TryOnCrafter는 프록시 기반 제약으로 이 문제를 완화했다.
Ablation 결과: 렌더된 비디오(𝒱_render)를 제거하면 VFID 지표가 크게 악화(VFID 상승)되어 명시적 기하학 anchoring이 구조적 무결성 유지에 필수적임이 드러났다. 또한 CRA와 garment/text semantics를 제거한 경우 cross-view ID 보존 및 언페어드 일반화 성능이 저하되었다.
정성적 비교: Fig.4 및 추가 그림에서 TryOnCrafter는 복잡한 실외 환경과 긴 의상(예: 바지, 루즈 드레스)에서 텍스처 보존 및 실루엣 복원이 우수하며, 기존 방법들은 극단적 카메라 회전에서 의상 왜곡·단절 현상을 보였다.
관련 Figure

이 Figure는 4D Try-on Proxy가 DiT 합성 과정에 구조적 앵커로 작동해 원본에 없는 카메라 궤적에서도 의상 텍스처와 인물 포즈를 일관되게 재현함을 시각적으로 증명한다. 렌더된 프록시 열이 DiT의 제약으로 작용해 합성 결과의 실루엣·주름·색상 일관성이 확보된 점이 드러난다.
TryOnCrafter의 결과 예시: 소스 비디오, 렌더된 프록시, 합성된 시퀀스 비교를 통해 임의 카메라 궤적에서 텍스처·구조가 유지되는 모습을 보여준다.

이 비교 이미지는 TryOnCrafter가 복잡한 의상 패턴과 긴 실루엣(예: 바지, 드레스)을 더 정확히 복원하는 반면, 기존 방법들은 텍스처 손실이나 구조 붕괴를 일으키는 사례를 보여준다. 결과는 렌더된 4D 프록시가 복잡한 기하학적 제약을 유지하는 데 기여함을 시사한다.
ViViD 및 in-the-wild 데이터셋에서의 정성적 비교: CatV2TON, Magic-Tryon 등 기존 방법과의 시각적 성능 차이를 보여준다.

이 Figure는 TryOnCrafter가 렌더된 프록시를 사용해 입력에 없는 궤적에서도 구조적 일관성과 텍스처 지속성을 유지함을 보인다. 특히 두-단계 방식에서 나타나는 회전·원근 변형으로 인한 의상 왜곡이 프록시 기반 통합 파이프라인에서 완화된다.
다양한 카메라 궤적(orbit, relocalization, bullet time)에서의 합성 결과 및 두-단계 기법과의 비교를 보여주는 정성적 실험 결과.
기술 상세
전체 아키텍처 구조: TryOnCrafter는 (1) 4D Try-on Proxy Construction 모듈과 (2) Proxy-Anchored Video DiT 모듈로 구성된다. 4D 프록시는 포인트 클라우드 기반 배경 P^b, 앵커 정렬된 SMPL-X 시퀀스, 그리고 canonical 3DGS avatar G_c의 조합으로 만들어진다. Proxy는 hybrid renderer를 통해 픽셀-정렬된 렌더 비디오 V_render를 출력하고, 이 V_render가 DiT의 주요 구조적 prior로 작동한다.
CRA의 알고리즘적/수학적 기반: DiT의 각 블록에서 참조 신호를 주입하기 위해 CRA는 다음 연산을 수행한다. 입력 feature F_i(메인 블록)와 reference feature F_l가 주어지면, F_i의 stop-gradient(sg)된 값에 대해 W_Q'를 적용하고 F_l에 W_K,W_V를 적용한다. 연산 순서 — [입력: F_i, F_l, projection weights W_Q', W_K, W_V, W_O'] → [연산: A = Softmax((sg(F_i)W_Q')(F_l W_K)^T / sqrt(d)); O_l' = A (F_l W_V) · W_O'] → [결과: 참조 잔차 O_l'] → [의미: DiT의 표준 Attn 출력에 additive residual로 합쳐져 cross-view identity와 배경 디테일을 보강]. 이때 K/V는 backbone과 weight-sharing, Q'/O'는 독립 학습으로 설계되어 사전학습된 generative prior를 크게 훼손하지 않으면서도 참조 신호를 주입한다.
3DGS 아바타·LBS·렌더링: canonical 3DGS avatar는 Gaussian primitive들로 구성되며 각 primitive는 (x_i, Σ_i, σ_i, c_i)를 가진다. LBS에서는 skinning weights w_j를 인접 SMPL-X 정점으로부터 쿼리하고 변환 행렬 T_j,R'_j로 primitive를 변형한다: x = T(∑_j w_j T_j x_c), Σ = R(∑_j w_j R'_j Σ_c R'_j^T) R^T. 변형된 primitive는 3DGS rasterizer로 렌더되고 배경 포인트 클라우드는 point-based renderer로 처리되어 합성용 prior 영상을 생성한다.
학습·추론 세부: 모델은 Wan2.1-I2V-14B 기반으로 progressive two-stage training을 수행했다. 학습은 16 NVIDIA A100(80GB)에서 진행되었고, 추론 시 20 denoising steps 및 CFG scale=6.0을 사용했다. 손실 함수는 표준 diffusion objective(노이즈 예측) 외에 픽셀-정렬된 prior와의 동기화를 위한 조건부 구성요소를 포함한다(세부 값은 Supplementary Material).
한계점
논문에 명시된 제한 사항만 기술한다. (1) 극단적 시점 전환에서의 parallax와 SMPL-X 추정 부정확성으로 인해 손·사지 등 일부 관절의 정렬 오류 및 미세 기하학 불일치가 발생한다. (2) DiT 기반 반복적 denoising 과정으로 인한 높은 추론 비용으로 실시간 인터랙션에는 부적합하다.
관련 Figure

이 Figure는 각 구성 요소의 중요성을 보여준다: 아바타 미사용 시 텍스처·포즈 불안정이 발생하고, 배경 미보존 시 조명·환경 정합이 손상되며 CRA 미탑재 시 ID 보존·cross-view 정합이 악화된다. 오른쪽의 실패 사례는 극단적 원근·SMPL-X 추정 오차가 여전히 구조적 불일치를 초래함을 시사한다.
주요 구성 요소별 제거 실험(w/o Human Avatar, w/o background, w/o CRA 등) 및 실패 사례(원근·SMPL-X 부정확성) 예시.
실무 활용
TryOnCrafter의 렌더 가능한 4D 프록시는 인간·배경·카메라를 분리한 world-space 편집을 지원해 실제 응용에서 시점 제어 기반의 제품 시각화 및 인터랙티브 피팅을 가능하게 한다. 다만 코드 공개 여부는 명시되어 있지 않아 직접 적용 시 구현·연산 자원 확보가 필요하다.
- 전자상거래: 사용자가 제품 페이지에서 360° 회전·확대하여 의상 측면·후면 디테일을 확인하는 가상 피팅 기능
- 마케팅 콘텐츠 제작: 하나의 촬영 클립에서 다양한 카메라 궤적(orbit, zoom, bullet time)을 생성해 영상 자산을 다양화
- AR/VR 시나리오: 실시간성 요구를 낮춘 오프라인/반실시간 콘텐츠 제작 파이프라인에서 사용자 맞춤 착용 시각화
코드 공개 여부: 미확인
관련 Figure

이 그림은 프록시를 world-space에 정렬함으로써 인물 위치 편집(Human Relocalization), 완전한 궤적 생성(360° orbital) 및 단일 포즈를 고정한 카메라 회전(Bullet Time) 같은 downstream 응용이 가능함을 시연한다. 즉, 4D 표현이 단순 합성을 넘어 편집 가능성을 제공함을 시각적으로 입증한다.
TryOnCrafter의 응용 사례: Human Relocalization, 360-degree orbital viewing, Bullet Time 연출 결과 샘플.
키워드
용어 해설
- SMPL-X
- — SMPL-X는 사람의 골격과 표면 형상을 파라메트릭으로 표현하는 모델이다. 논문에서는 각 프레임의 인체 관절·메시 정보를 시공간 연속 시퀀스({Θ_t})로 추정하여 3D 공간에서 아바타 스킨닝과 포즈 구동 신호로 사용한다. 이는 인간 동역학을 분리·재배치하기 위한 기준 좌표계로 활용된다.
- 3DGS
- — 3DGS는 점·가우시안 원시요소(gaussian primitives)를 이용해 장면을 표현하고 렌더링하는 기법이다. 본문에서는 옷을 입힌 canonical 3DGS-based avatar를 생성해 세밀한 텍스처와 뷰의존적 외관을 캡처하고, LBS로 구동하여 시간적 일관성을 확보한다.
- DiT
- — DiT는 Transformer 기반의 diffusion 모델로, 비디오 합성에 확산-변환기 구조를 적용한다. TryOnCrafter는 DiT를 backbone으로 사용하여 렌더된 4D 프록시(prior)를 조건으로 받아 프레임 간 구조적 제약을 유지하면서 고품질 비디오를 생성한다.
- LBS
- — LBS는 아바타의 원시 요소(여기서는 gaussian primitives)를 골격 변환으로 변형하는 표준 기법이다. canonical 3DGS avatar의 각 primitive에 대해 인접 SMPL-X 정점으로부터 스킨닝 가중치를 쿼리해 관절 변환을 선형 혼합하여 포즈별 위치·공분산을 계산한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.