용어 해설
- Rotary Positional Encoding(RoPE)
- — 토큰 위치 정보를 회전 방식으로 인코딩하는 positional encoding 기법이다. 본 논문에서는 video token과 reference image token을 서로 다른 RoPE 공간에 위치시키므로 토큰 간의 '위치 기반 유사도'를 독립적으로 제어할 수 있어 동일 주체의 참조 이미지를 서로 가깝게, 다른 주체의 참조를 멀게 유지한다.
- Adaptive Layer Normalization(AdaLN)
- — Layer Normalization의 scale/shift를 외부 조건으로 조절하는 기법이다. 본 논문에서는 reference branch의 AdaLN에 도메인 속성(domain attribute)과 시간 정보를 입력으로 주어 도메인별 특징(스타일, 조명 등)을 분리하여 주체(content)와 도메인(domain)을 구조적으로 분리한다.
- Flow-matching 손실(Flow-Matching Loss)
- — 연속시간 노이즈 조건화에서 벡터장 Gθ가 (z1−z0)를 예측하도록 L2 거리로 학습하는 손실이다. 입력으로 zt,t, text/refs를 받아 Gθ(·)를 계산 → 예측벡터와 (z1−z0)의 차이를 제곱합으로 계산 → 평균을 취하면 모델의 역방향 노이즈 추정 오차가 나온다. DiT 기반 학습에서 우선 사용된다.
- 3D 변분 오토인코더(3D VAE)
- — 연속 프레임을 잠재공간으로 인코딩하는 VAE 구조이다. 비디오 프레임 시퀀스를 3차원(latent frames × H × W) 잠재로 매핑하여 디퓨전 모델의 입력으로 사용된다. 본 논문은 3D VAE로 비디오와 참조 이미지를 latent로 변환한 뒤 각기 다른 처리 경로로 보낸다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.





