TL;DR
장편 서사나 뮤직비디오처럼 여러 컷이 연속되는 영상에서 인물의 외형·음성·장면 컨텍스트 일관성 유지가 필수적이다. UnityShots는 컷 경계의 시각·음향 신호를 활용해 고정 크기 메모리 슬롯을 제어함으로써 샷 간 신원·음성 일관성을 크게 개선한다.
왜 중요한가
장편 서사나 뮤직비디오처럼 여러 컷이 연속되는 영상에서 인물의 외형·음성·장면 컨텍스트 일관성 유지가 필수적이다. UnityShots는 컷 경계의 시각·음향 신호를 활용해 고정 크기 메모리 슬롯을 제어함으로써 샷 간 신원·음성 일관성을 크게 개선한다.
핵심 기여
Dual-slot memory bank (LTM + STM)
비디오 스트림에 두 개의 고정 크기 슬롯을 둬 LTM(오프닝 샷 고정 앵커, 2 latent frames)과 STM(직전 테일, P_v=4 frames)을 유지한다. 슬롯 갱신은 O(1) 비용으로 처리되어 시퀀스 길이에 따라 메모리가 선형으로 증가하지 않는다.
Boundary-conditioned gating that fuses visual and audio cues
컷 경계를 b_N = τ_N⋅(α s_vis + β s_aud + γ s_beat)로 계산하고, 이 연속 점수를 기반으로 g_ltm(b) 및 g_stm(b)를 생성해 각 슬롯의 쓰기·읽기 비중을 조절한다. τ_N은 이산적 cut-type prior( first / continue / hard )이고, s_vis는 TransNetv2, s_aud는 RMS 에너지 변화, s_beat는 beat-tracker 값이다.
Reference speaker token for cross-shot audio anchoring
오디오 일관성은 슬라이딩 오디오 뱅크 대신 매 샷에 고정 참조 화자 토큰을 주입해 화자 timbre를 보존한다. 참조 오디오 드롭아웃(p=0.1)으로 text-only fallback을 지원한다.
Cut-type prior via AdaLN for inference-time control
각 transition type τ_N 임베딩을 AdaLN에 주입해 모델 내부에서 전환 강도를 조절하는 제어 변수를 제공한다. 인퍼런스에서 τ_N을 직접 설정하면 메모리 리셋 강도를 제어할 수 있다.
Multi-cultural multi-shot benchmark and data release
6개 민족권, 10개 이상 언어, 총 200 multi-shot sequences를 공개하고, 146k 주석 샷(116k cinematic + 30k music-video)으로 학습 데이터 파이프라인을 구성해 재현 가능한 벤치마크를 제공한다. 코드와 체크포인트를 공개했다.
핵심 아이디어 이해하기
문제 출발점과 기존 한계: 멀티샷 영상 생성에서는 샷 간 '신원(identity)·장면(scene)·화자' 일관성 유지가 필요하다. 기존 end-to-end 방식은 전체 시퀀스를 하나의 컨텍스트로 처리해 GPU 메모리 한계로 긴 시퀀스를 다루기 어렵고, shot-by-shot 방식은 조건창이 열을 지나가면 오리지널 앵커 정보가 지워져 identity drift가 발생하거나 메모리 뱅크가 시퀀스 길이에 따라 선형으로 증가한다. 에이전트 기반 파이프라인은 외부 LLM으로 오케스트레이션하지만 기반 생성기는 cross-shot 신호를 내부적으로 전파하도록 학습되지 않은 경우가 많다.
방법론
전체 접근과 핵심 아이디어: UnityShots는 LTX-2.3(22B dual-stream diffusion transformer)을 백본으로 사용하고 비디오 스트림에 두 개의 고정 크기 슬롯(LTM, STM)을 둔다. 각 샷 경계마다 시각적 컷 확률(s_vis), 오디오 에너지 변화(s_aud), 박자 위치(s_beat)를 가중 결합해 연속 경계 점수 b_N을 계산하고, 이를 통해 LTM·STM의 갱신 게이트 g_ltm(b)와 g_stm(b)를 구해 메모리 업데이트 비중을 조정한다. 오디오는 참조 화자 토큰을 매 샷 주입해 화자 일관성을 유지한다.
관련 Figure

7단계 데이터 처리 파이프라인(샷 분할, 자막 처리, 오디오 분리, 멀티모달 주석, 캐릭터 앵커링, 병합, 품질 필터링)과 평가용 벤치마크 구성 과정을 상세히 보여준다. 이 다이어그램은 146k 학습 샷과 200 시퀀스 벤치마크 출처 및 전처리 도구(TransNetv2, Whisper/DEMUCS, Qwen3-VL 등)를 연결해 데이터의 재현성을 뒷받침한다.
학습 데이터 구축과 벤치마크 생성 파이프라인을 도식화한 다이어그램이다.

다양한 민족·언어 컨텍스트에서 동일 인물의 참조 초상이 샷 전반에 걸쳐 유지되는 구조적 요구를 시각적으로 제시한다. 벤치마크의 문화적 다양성은 모델의 일반화·공정성 평가 측면에서 중요하다.
200개 multi-cultural benchmark의 대표 시퀀스와 참조 초상, per-shot first-frame 샘플을 요약한 패널이다.
주요 결과
메인 벤치마크 성능: UnityShots(I2V)는 제안된 multi-cultural benchmark에서 open-source I2V baselines 대비 모든 비디오 및 cross-shot coherence 지표에서 선두를 차지했으며, Narrative Coherence(NC)에서 가장 강한 오픈소스 대비 +0.40, Story에서 +0.69 향상치를 보고했다. Closed-source Kling과 비교해 NC +0.13, Story +0.10, 오디오 AES-A +0.47 우위를 보였다. T2V 및 R2V 모드에서도 HoloCine와 DreamID-Omni 대비 다수 지표에서 우세를 보였다.
관련 Figure

이 Figure는 LTX-2.3 및 ID-LoRA 등 오픈소스와 UnityShots 결과를 나란히 배치해 샷 2 이후 발생하는 identity drift 차이를 시각적으로 보여준다. LTM 슬롯이 오프닝 샷 앵커로 작용해 다양한 카메라 앵글에서 인물의 얼굴·의상·프레이밍을 보존하는 효과를 시각적으로 확인할 수 있다.
다양한 메서드(I2V) 비교에서 UnityShots가 샷 간 인물 신원 일관성을 유지하는 정성적 예시를 제시한 패널이다.

같은 스토리 프롬프트에 대해 UnityShots가 인물의 외형과 장면 맥락을 유지한 채 다음 샷을 생성함을 보여준다. Baseline과 LTM/STM 단독 변형에서 발생하는 드리프트, 프레이밍 차이, 오디오 타이밍 불일치가 UnityShots에서 완화된 점이 확인된다.
해안 장면(Shot1..3)에서 Baseline, LTM, STM, UnityShots 결과를 비교한 정성 실험 패널이다.

다양한 문화적 배경과 스토리에서 UnityShots의 샷 간 일관성이 유지되는 패턴이 반복적으로 관찰된다. 정성적 비교는 수치 지표(NC, Char 등)와 정렬되어 모델의 cross-shot 개선이 시각적·서사적 인지에 반영됨을 보강한다.
여러 시퀀스에 걸친 UnityShots와 경쟁 기법의 정성 비교격자다.

왼쪽 그래프는 각 샷 인덱스별 UnityShots의 identity 보존 점수가 경쟁 모델보다 높게 유지되는 것을 보여주고, 오른쪽 누적 그래프는 긴 시퀀스에서 UnityShots가 누적 우위를 확보해 최종적으로 +0.11의 이득을 기록한 사실을 정량적으로 보강한다.
샷 지평(shot horizon)에 따른 per-shot identity 보존(RIC-Subj/NC) 그래프와 누적 지표 비교 그래프다.

32인 human study 결과에서 UnityShots가 오픈소스 기법 대비 정성적 선호(특히 identity·overall) 비율에서 우위를 보였음을 수치적으로 보여준다. 인간 판단이 Gemini 평가 순위와 일치함을 확인해 자동 평가의 신뢰도를 보완한다.
인간 평가(pairwise) 결과의 막대그래프: Identity, Audio, Text, Overall 기준에서 UnityShots가 상대 우위를 기록한 비율을 보여준다.
기술 상세
아키텍처 구조: 백본은 LTX-2.3, 22B 파라미터의 dual-stream diffusion transformer다. 비디오 토큰은 Block-Relativistic 3D RoPE(temporal ceiling f_lim=128)를 사용하고 오디오는 별도 1-D RoPE(f_lim^a=1024)를 사용한다. 입력 토큰 시퀀스는 [X_ref, L^N, S^N, A_ref, V_t^N ⊕ A_t^N] 형태로 결합되어 shared dual-stream attention 블록으로 처리된다.
한계점
논문에서 명시된 한계는 자막 렌더링의 간헐적 불안정성, 동시 다중 화자가 존재하거나 구성적으로 복잡한 장면에서의 시각적 열화가 포함된다.
실무 활용
UnityShots는 장편 내러티브·뮤직비디오·단편 드라마 등 컷 편집이 포함된 영상 제작 파이프라인의 자동화·프로덕션 보조에 활용 가능하다. 참조 이미지·오디오를 입력으로 받아 샷 간 신원·음성 일관성을 확보한 상태로 연속 샷을 생성한다.
- 스크립트 기반 멀티샷 컷 생성: per-shot prompt와 참조 인물로 시퀀스 생성 후 편집자에게 전달
- 에이전트 오케스트레이션 파이프라인에서의 per-shot 생성 도구: 외부 LLM이 각 샷을 호출해 긴 시퀀스 제작
- 다국어·다문화 단편 영상 제작에서 인물 신원·음성 보존이 필요한 합성 콘텐츠 생산
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Dual-Stream Diffusion
- — 비디오와 오디오를 별도의 토큰·로테이션·스트림으로 처리하고 동일한 모델 블록에서 공동으로 denoise하는 구조이다. 이 논문에서는 비디오와 오디오 latents를 병렬로 입력해 동기화된 멀티모달 출력을 생성하며, cross-shot 메모리 블록을 두 스트림에 결합해 일관성을 유지하는 데 핵심 역할을 한다.
- AdaLN
- — 작은 임베딩을 LayerNorm의 scale/shift에 주입해 블록별로 조건화하는 기법이다. 본문에서는 이산적 cut-type prior 임베딩을 AdaLN에 넣어 전파 시 전환 강도를 제어하는 제어 변수가 된다.
- Strata-RoPE
- — 정수 축에서 서로 다른 위치 대역(strata)을 예약해 현재 샷, STM, LTM 토큰을 물리적 거리로 분리하는 RoPE 변형이다. 이 방식은 rotary kernel의 거리 감쇠를 이용해 서로 다른 메모리 밴드 간 상호작용을 자동으로 감소시키며, 별도 토큰 없이 슬롯 분리를 구현한다.
- Reference Speaker Token
- — 각 시퀀스에서 추출한 참조 오디오로부터 고정 토큰을 생성해 매 샷 입력에 주입하는 방식이다. 슬라이딩 오디오 뱅크를 유지하지 않고도 화자 음색(timbre) 일관성을 보장하는 역할을 한다.
- Beat-Tracker
- — 입력 오디오의 박자 위치와 세기(beat position/strength)를 산출하는 알고리즘이다. 본 논문에서는 박자 신호(s_beat)를 경계 점수 계산에 포함해 시각적 컷 확률과 결합해 메모리 갱신 강도를 조정한다.
- TransNetv2
- — 비디오에서 샷 경계를 검출하는 신경망이다. 훈련 데이터 구축에서 샷 분할을 자동화하는 데 쓰이며, UnityShots 학습 파이프라인에서 각 클립의 샷 단위 표기를 얻는 데 사용되었다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.