TL;DR
사용자가 제공한 참조 이미지의 '주체(subject)' 특징을 보존하면서도 스타일·도메인을 자유롭게 바꾸는 텍스트-투-비디오 생성이 가능해진다. 기존 기법이 주로 한쪽(고충실도 유지 또는 편집 유연성)에 치우쳤던 문제를 균형 있게 처리하여 실무적 개인화와 창작적 도메인 전환을 동시에 만족한다.
왜 중요한가
사용자가 제공한 참조 이미지의 '주체(subject)' 특징을 보존하면서도 스타일·도메인을 자유롭게 바꾸는 텍스트-투-비디오 생성이 가능해진다. 기존 기법이 주로 한쪽(고충실도 유지 또는 편집 유연성)에 치우쳤던 문제를 균형 있게 처리하여 실무적 개인화와 창작적 도메인 전환을 동시에 만족한다.
관련 Figure

Teaser는 본 연구의 목표인 '참조 주체의 일관성 유지'와 '도메인 전환의 유연성'을 동시에 달성하는 점을 시각적으로 제시한다. 다양한 시나리오(다중 객체·다중 인물·실사↔판타지 변환)를 포함해 DomainShuttle이 기존 방법보다 교차 도메인에서 더 안정적으로 주체를 보존하면서 스타일을 적용하는 것을 보여준다.
DomainShuttle의 적용 사례(인-도메인 vs 크로스-도메인)와 기존 방법 대비 성능 차이를 시각적으로 대비한 Teaser 이미지이다.
핵심 기여
Domain-MoT: 비디오/참조 분리 처리 경로와 domain-aware AdaLN
비디오 latents와 참조 이미지 특징을 서로 분리된 Transformer 처리 경로로 입력하고, 참조 경로에 domain-aware AdaLN을 적용하여 도메인 속성(domain attribute)과 내용(content)을 구조적으로 분리한다. 참조 AdaLN은 시간(t)과 도메인(a)을 조건으로 scale/shift/gate를 생성해 도메인 전환 시 주체 속성은 보존하면서 스타일·조명을 교체할 수 있게 한다.
Video-Reference DualRoPE: 참조와 비디오를 독립 RoPE 공간으로 분리
참조 이미지 토큰과 비디오 토큰에 서로 다른 RoPE 인덱스를 할당하여 위치·주체별 거리 관계를 정밀하게 제어한다. 참조의 시간 인덱스를 0으로 고정하고 오프셋 규칙(예: 동일 주체의 다중 참조는 width 오프셋만 적용)을 적용해 같은 주체의 참조는 잠재공간에서 가깝게, 다른 주체는 멀게 유지한다.
Cross-Pair Consistent Loss (CCL): 동일 비디오에 대한 서로 다른 참조 세트 일관성 학습
참조 풀에서 두 서로 다른 참조 세트를 무작위 샘플링하여 동일 노이즈 시점에서 두 분기(한 분기는 frozen, 다른 분기는 학습가능)의 출력 벡터필드 차이를 L2로 정렬한다. 입력으로 같은 zt,t,text를 주어 → 두 분기의 G(·) 출력을 계산 → L2 차이를 최소화하면 주체의 본질적 특징(형태·텍스처·정체성)이 조명·구도·모션 변화에 불변하게 학습된다.
핵심 아이디어 이해하기
문제 출발점과 기존 한계: 주체 기반 텍스트-투-비디오(S2V)는 참조 이미지로부터 주체의 고유 속성(identity, hairstyle, skin color, clothing 등)을 보존하면서 텍스트로 지시한 스타일·도메인 변화를 적용해야 한다. 기존 접근은 주로 참조 충실도(인-도메인)에 초점을 맞춰 참조의 도메인 속성까지 함께 고정하는 경향이 있어 교차 도메인 변형(예: 실사→워터칼라, 판타지→실사)에서 편집 가능성이 떨어진다.
방법론
전체 접근과 핵심 아이디어: 모델 구조는 DiT 기반 비디오 디퓨전 백본을 사용하되, 비디오 latents와 참조 이미지 특징을 별도 경로로 처리하는 Domain-MoT로 분리한다. 분리된 경로는 자체 QKV와 RoPE를 가지며 참조 경로에는 domain-aware AdaLN이 삽입되어 도메인 속성만 별도로 주입한다. 텍스트-교차어텐션은 동결(frozen)하여 기본 모델의 텍스트 추종 능력을 유지한다.
Domain-MoT의 상세 메커니즘: 입력으로 3D VAE로 인코딩된 video latent와 reference features가 주어진다 → 각 경로를 patchify하여 fv, fr를 얻는다 → 각각 독립적인 Qv,Kv,Vv와 Qr,Kr,Vr를 학습 가능한 가중치로 투사한다 → in-context self-attention은 [Rv(Qv); Rr(Qr)]·[Rv(Kv);Rr(Kr)]/√d에 softmax를 적용해 [Vv, Vr]을 결합한다. 이때 Rv와 Rr는 서로 다른 RoPE 공간이다. 텍스트 cross-attention은 Qc(=Wq·[fv;fr])와 Kt,Vt(텍스트 임베딩)를 이용하며 해당 모듈은 동결되어 텍스트 지시가 유지된다.
Domain-aware AdaLN와 연산 흐름: 참조 AdaLN은 시간 t와 도메인 a를 입력으로 받아 scale γr(t,a), shift βr(t,a), gate gr(t,a)를 산출한다 → LN(fr)를 (1+γr)로 스케일하고 +βr를 더한 뒤 residual function ℱ(·)을 통과시킨 결과에 gate로 스케일링하고 원래 fr에 더해 최종 modulated reference feature를 얻는다. 비디오 쪽 AdaLN은 시간 정보만으로 조절되어 콘텐츠·시간적 구조를 보전한다.
Video-Reference DualRoPE와 CCL 구현: DualRoPE는 참조의 temporal index를 0으로 고정하고 spatial offsets 규칙(예: 서로 다른 주체 간 Δ=(0,h,w), 동일 주체의 다중 참조는 Δ=(0,0,w))을 적용한다. CCL은 참조 풀에서 서로 다른 두 참조 세트를 샘플링하여 동일 zt,t,text를 넣고 → 학습 가능한 분기 Gθ와 frozen 분기 Gθ의 출력 차이를 L2로 계산해(ℒC=||Gθ(zt,t,ct,cr)−Gθ(zt,t,ct,cr*)||2^2) trainable branch의 표현이 참조 변화에 불변하도록 학습시킨다.
관련 Figure

해당 다이어그램은 아키텍처의 핵심 설계(분리된 video/ref 경로, domain-aware AdaLN의 위치, DualRoPE의 RoPE 분리, CCL의 frozen vs trainable 분기)를 한눈에 보여준다. 연구 기법이 '왜' 동작하는지(분리→도메인 주입→동일 노이즈 시점에서의 정렬)와 각 요소의 상호작용을 이해하는 데 직접적 근거를 제공한다.
Domain-MoT 아키텍처, Video-Reference DualRoPE, Cross-Pair Consistent Loss의 모듈별 구조와 데이터 흐름을 요약한 다이어그램이다.

이 Figure는 복잡한 상호작용(예: 실사 인물과 판타지 캐릭터의 상호작용)에서 DualRoPE와 CCL의 효과를 강조한다. DualRoPE 부재 시 잘못된 공간 위치에 캐릭터가 생성되거나 CCL 부재 시 참조의 직접 복사가 발생하는 사례가 비교되어 모듈별 기여를 시각적으로 확인할 수 있다.
다른 스타일·상호작용 사례에 대한 정성적 비교(3D 스타일, 캐릭터 합성 등) 결과 모음이다.
주요 결과
메인 벤치마크 결과: 테스트셋은 인-도메인 110개, 크로스-도메인 110개 샘플로 구성되어 있다. 정량 결과에서 DomainShuttle (Wan2.2-14B)는 Cross-Domain CD-Score에서 18.7% 개선을 기록했고(예: CD-Score 0.861), text controllability( GMEScore 0.705 )와 motion smoothness 등 주요 지표에서 상위권을 차지했다. 표 1의 행별 비교에서 Wan2.2 기반의 DomainShuttle이 종합적으로 우수한 성능을 보였다.
Ablation 결과: Domain-MoT 단독으로 Naive 방식 대비 CD-Score를 0.697→0.783으로 향상시켰다. VR-DualRoPE와 CCL을 순차적으로 추가하면 CD-Score와 controllability가 계속 개선되어 최종 모델이 가장 높은 성능을 얻었다(테이블 2 참조). CCL은 주로 교차 도메인 컨트롤러능력 개선에 기여했으며(예: CD-Score +5.9%), 충실도(CLIP/DINO)는 소폭 향상에 그쳤다.
사용자 평가: 40명의 평가자에 의한 주관 평가에서 DomainShuttle 평균 점수는 Overall Video Quality 4.29, Text Controllability 4.33, Open-Domain Subject Consistency 4.75로 비교군 대비 유의미하게 높게 나타났다(비교군 예: Kling 1.6의 동일 지표 3.2 / 3.12 / 2.9).
관련 Figure

정성 결과는 DomainShuttle이 교차 도메인에서 주체 특성을 더 잘 보존하면서 텍스트 스타일 지시를 따르는 경향을 보인다는 정량 지표의 시각적 보완 증거이다. 특히 기존 방법들이 스타일을 따르는 과정에서 주체를 훼손하거나 누락하는 경우가 빈번한 반면, DomainShuttle은 주체 ID 유지와 스타일 반영의 균형을 달성했다.
다양한 스타일(워터칼라, 애니메이션 등) 적용 사례에서 DomainShuttle과 여러 비교 기법의 정성적 결과를 나란히 비교한 이미지이다.

Ablation Figure는 Naive, Dual Self-Attn, Domain-MoT, VR-DualRoPE, CCL의 순차적 추가가 성능에 미치는 영향을 정성적으로 보여준다. 특히 주체-기반 오프셋 전략(subject-decoupled)이 동일 주체의 다중 참조 결속(binding)을 더 잘 유지함을 시각적으로 입증한다.
모듈별 유효성 검증을 위한 Ablation 결과와 VR-DualRoPE의 decoupling 전략(참조-기반 vs 주체-기반) 비교 이미지이다.

사용자 평가는 정량 지표와 일치하며 DomainShuttle의 평균 점수(예: Open-Domain Subject Consistency 4.75)가 비교군 대비 크게 높은 것을 보여준다. 이 데이터는 자동화된 유사도 지표뿐 아니라 사람 관점에서도 주체 일관성과 제어성이 향상되었음을 뒷받침한다.
40인 사용자 평가 결과(Overall Video Quality, Text Controllability, Open-Domain Subject Consistency)를 막대그래프로 정리한 이미지이다.
기술 상세
전체 아키텍처: 백본은 DiT 기반의 DiT-style video diffusion model이며 입력 파이프라인은 3D VAE 인코더로 비디오와 참조 이미지를 latent space로 변환한다. 변환된 video latent와 reference feature는 Domain-MoT 내부에서 patchify되어 각각의 Transformer 경로로 들어간다. 각 Video DiT Block은 N층으로 쌓이며, 블록 내부에 독립 QKV, 독립 RoPE, domain-aware AdaLN, textual cross-attention(동결)이 포함된다. 출력은 flow-matching loss로 학습되는 vector field Gθ를 통해 재구성된다.
실무 활용
코드와 모델이 공개되어 있어(https://github.com/HKUST-C4G/DomainShuttle) 연구·프로토타입 단계에서 참조 기반 비디오 퍼스널라이제이션과 도메인 전환 실험에 바로 적용 가능하다. 교차 도메인 편집이나 광고·콘텐츠 제작에서 참조 주체를 유지하면서 스타일을 바꾸는 워크플로에 적합하다.
- 광고·마케팅: 인물 또는 제품의 동일성을 유지한 채 다양한 시각적 스타일(워터칼라, 애니메이션 등)로 비디오 제작
- 콘텐츠 제작: 실사 주체를 판타지 도메인으로 매핑하거나 판타지 IP를 실사 소품에 합성하는 영상 연출
- 비디오 퍼스널라이제이션: 사용자 제공 사진 기반의 개인화된 비디오 광고·축하 메시지 자동 생성
- 데이터 증강: 동일 주체의 다양한 도메인 변형을 생성해 downstream 학습 데이터 확장
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- RoPE
- — 토큰 위치 정보를 회전 방식으로 인코딩하는 positional encoding 기법이다. 본 논문에서는 video token과 reference image token을 서로 다른 RoPE 공간에 위치시키므로 토큰 간의 '위치 기반 유사도'를 독립적으로 제어할 수 있어 동일 주체의 참조 이미지를 서로 가깝게, 다른 주체의 참조를 멀게 유지한다.
- AdaLN
- — Layer Normalization의 scale/shift를 외부 조건으로 조절하는 기법이다. 본 논문에서는 reference branch의 AdaLN에 도메인 속성(domain attribute)과 시간 정보를 입력으로 주어 도메인별 특징(스타일, 조명 등)을 분리하여 주체(content)와 도메인(domain)을 구조적으로 분리한다.
- Flow-Matching Loss
- — 연속시간 노이즈 조건화에서 벡터장 Gθ가 (z1−z0)를 예측하도록 L2 거리로 학습하는 손실이다. 입력으로 zt,t, text/refs를 받아 Gθ(·)를 계산 → 예측벡터와 (z1−z0)의 차이를 제곱합으로 계산 → 평균을 취하면 모델의 역방향 노이즈 추정 오차가 나온다. DiT 기반 학습에서 우선 사용된다.
- 3D VAE
- — 연속 프레임을 잠재공간으로 인코딩하는 VAE 구조이다. 비디오 프레임 시퀀스를 3차원(latent frames × H × W) 잠재로 매핑하여 디퓨전 모델의 입력으로 사용된다. 본 논문은 3D VAE로 비디오와 참조 이미지를 latent로 변환한 뒤 각기 다른 처리 경로로 보낸다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.