본문으로 건너뛰기
HF Daily Papers조회 1

DomainShuttle: 자유 형식 오픈 도메인 주체 기반 텍스트-투-비디오 생성

사용자가 제공한 참조 이미지의 '주체(subject)' 특징을 보존하면서도 스타일·도메인을 자유롭게 바꾸는 텍스트-투-비디오 생성이 가능해진다. 기존 기법이 주로 한쪽(고충실도 유지 또는 편집 유연성)에 치우쳤던 문제를 균형 있게 처리하여 실무적 개인화와 창작적 도메인 전환을 동시에 만족한다.

용어 해설

Rotary Positional Encoding(RoPE)
토큰 위치 정보를 회전 방식으로 인코딩하는 positional encoding 기법이다. 본 논문에서는 video token과 reference image token을 서로 다른 RoPE 공간에 위치시키므로 토큰 간의 '위치 기반 유사도'를 독립적으로 제어할 수 있어 동일 주체의 참조 이미지를 서로 가깝게, 다른 주체의 참조를 멀게 유지한다.
Adaptive Layer Normalization(AdaLN)
Layer Normalization의 scale/shift를 외부 조건으로 조절하는 기법이다. 본 논문에서는 reference branch의 AdaLN에 도메인 속성(domain attribute)과 시간 정보를 입력으로 주어 도메인별 특징(스타일, 조명 등)을 분리하여 주체(content)와 도메인(domain)을 구조적으로 분리한다.
Flow-matching 손실(Flow-Matching Loss)
연속시간 노이즈 조건화에서 벡터장 Gθ가 (z1−z0)를 예측하도록 L2 거리로 학습하는 손실이다. 입력으로 zt,t, text/refs를 받아 Gθ(·)를 계산 → 예측벡터와 (z1−z0)의 차이를 제곱합으로 계산 → 평균을 취하면 모델의 역방향 노이즈 추정 오차가 나온다. DiT 기반 학습에서 우선 사용된다.
3D 변분 오토인코더(3D VAE)
연속 프레임을 잠재공간으로 인코딩하는 VAE 구조이다. 비디오 프레임 시퀀스를 3차원(latent frames × H × W) 잠재로 매핑하여 디퓨전 모델의 입력으로 사용된다. 본 논문은 3D VAE로 비디오와 참조 이미지를 latent로 변환한 뒤 각기 다른 처리 경로로 보낸다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 24.수집 2026. 06. 26.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.