용어 해설
- 이중 스트림 확산모델(Dual-Stream Diffusion)
- — 비디오와 오디오를 별도의 토큰·로테이션·스트림으로 처리하고 동일한 모델 블록에서 공동으로 denoise하는 구조이다. 이 논문에서는 비디오와 오디오 latents를 병렬로 입력해 동기화된 멀티모달 출력을 생성하며, cross-shot 메모리 블록을 두 스트림에 결합해 일관성을 유지하는 데 핵심 역할을 한다.
- AdaLN (Adaptive LayerNorm)(AdaLN)
- — 작은 임베딩을 LayerNorm의 scale/shift에 주입해 블록별로 조건화하는 기법이다. 본문에서는 이산적 cut-type prior 임베딩을 AdaLN에 넣어 전파 시 전환 강도를 제어하는 제어 변수가 된다.
- Strata-RoPE (계층적 RoPE 위치 인코딩)(Strata-RoPE)
- — 정수 축에서 서로 다른 위치 대역(strata)을 예약해 현재 샷, STM, LTM 토큰을 물리적 거리로 분리하는 RoPE 변형이다. 이 방식은 rotary kernel의 거리 감쇠를 이용해 서로 다른 메모리 밴드 간 상호작용을 자동으로 감소시키며, 별도 토큰 없이 슬롯 분리를 구현한다.
- 참조 화자 토큰(Reference Speaker Token)
- — 각 시퀀스에서 추출한 참조 오디오로부터 고정 토큰을 생성해 매 샷 입력에 주입하는 방식이다. 슬라이딩 오디오 뱅크를 유지하지 않고도 화자 음색(timbre) 일관성을 보장하는 역할을 한다.
- 박자 추적기(Beat-Tracker)
- — 입력 오디오의 박자 위치와 세기(beat position/strength)를 산출하는 알고리즘이다. 본 논문에서는 박자 신호(s_beat)를 경계 점수 계산에 포함해 시각적 컷 확률과 결합해 메모리 갱신 강도를 조정한다.
- TransNetv2 (샷 분할 모델)(TransNetv2)
- — 비디오에서 샷 경계를 검출하는 신경망이다. 훈련 데이터 구축에서 샷 분할을 자동화하는 데 쓰이며, UnityShots 학습 파이프라인에서 각 클립의 샷 단위 표기를 얻는 데 사용되었다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.






