TL;DR
스트리밍 비디오 편집은 실시간 상호작용과 AR 응용에서 배경 보존과 극저지연을 동시에 만족해야 한다는 운영적 제약을 가진다. 기존의 고품질 bidirectional 편집기는 미래 프레임에 의존해 실시간 적용이 어렵고 기존의 스트리밍 생성기는 편집 보존성에서 손실이 발생했다. LiveEdit은 두 요구를 동시에 달성해 실시간 환경에서 고품질, 배경 보존, 낮은 지연을 충족할 수 있는 방법론을 제시한다.
왜 중요한가
스트리밍 비디오 편집은 실시간 상호작용과 AR 응용에서 배경 보존과 극저지연을 동시에 만족해야 한다는 운영적 제약을 가진다. 기존의 고품질 bidirectional 편집기는 미래 프레임에 의존해 실시간 적용이 어렵고 기존의 스트리밍 생성기는 편집 보존성에서 손실이 발생했다. LiveEdit은 두 요구를 동시에 달성해 실시간 환경에서 고품질, 배경 보존, 낮은 지연을 충족할 수 있는 방법론을 제시한다.
핵심 기여
세 단계 증류 파이프라인으로 Bidirectional 편집 능력의 인과적 이전
논문은 Foundation Tuning, Teacher Forcing, 그리고 DMD의 순차적 구성으로 Bidirectional DiT의 편집 능력을 Causal DiT 학생에게 단계적으로 이전했다. Foundation Tuning 단계에서는 full attention을 이용해 복잡한 편집 매핑을 학습했고 Teacher Forcing 단계에서는 chunk-wise causal attention으로 인과 분포를 정렬했다. 최종 DMD 단계에서는 생성 과정을 4단계로 압축해 실시간 응답성을 확보했다.
AR-oriented Mask Cache로 공간적 중복 계산을 동적으로 재사용
이 메커니즘은 이전 청크의 원본 잠재와 편집 결과 잠재의 L2 거리를 계산해 바이너리 편집 마스크를 생성한다. 마스크가 1인 활성 영역에만 Self-Attention, Cross-Attention, FFN의 전체 계산을 수행하고 마스크가 0인 영역은 이전 청크의 토큰 캐시를 재사용한다. 논문은 Self-Attention 수준에서 토큰의 시간적 유사성이 높아 캐시 적용이 품질 저하 없이 대규모 계산 절감을 가능하게 한다고 보고했다.
4-step 생성기로의 압축과 ODE 초기화 우회로 실시간 처리 달성
Stage 3에서 DMD를 통해 Real Score와 Fake Score 간의 분포 차이를 이용해 학생 생성기를 직접 최적화했다. 이 과정은 표준 ODE 기반 초기화를 우회하며 NFEs를 100에서 4로 줄여 추론 비용을 대폭 낮추었다. 결과적으로 문서에서는 79ms 프레임 지연과 12.66 FPS 수준의 실시간 처리 성능을 보고했다.
전용 스트리밍 편집 벤치마크와 다각적 정량평가
연구는 120쌍의 검증 데이터로 구성된 전용 벤치마크를 구축해 Text Alignment, Background Consistency, Motion Smoothness 등 6개 지표로 비교했다. 캐시 적용 버전은 Text Alignment 0.270과 Background Consistency 0.956, Motion Smoothness 0.992 등 높은 성능을 기록했다. 인간 평가도 병행되어 정렬성과 배경 보존 측면에서 우수성이 확인되었다.
핵심 아이디어 이해하기
스트리밍 비디오 편집의 출발점은 편집 작업에서 미래 프레임 접근이 불가능하다는 점이다. Bidirectional DiT는 과거와 미래를 모두 참조하는 dense temporal attention으로 구조적 정보를 전파해 고품질 편집을 수행했다. 그러나 미래 키·값을 제거하면 attention 분포가 평탄화되어 인접 프레임 중심의 국소적 정보가 약화되고 결과적으로 깜박임이나 구조 붕괴 현상이 발생했다. 이 논문은 이러한 분포 차이를 직접 해결하기 위해 단계적 증류 전략을 도입했다. 먼저 Bidirectional 모델에서 편집 능력을 획득한 뒤 chunk-wise causal attention을 가진 Causal DiT에 Teacher Forcing으로 분포 정렬을 수행했다. 이렇게 하면 causal 실행 환경에서도 bidirectional이 학습한 로컬 구조적 prior가 보존되어 인과적 추론 시 품질 저하가 억제된다. 또한 비편집 영역의 중복 토큰 처리에서 큰 비효율이 발생한다는 점에 주목했다. 영상 편집은 대부분 배경이 정적이거나 예측 가능한 움직임을 보이므로 Self-Attention의 중복성이 높았다. 따라서 이전 청크에서 계산된 Self-Attention 중간 표현을 재사용하면 전체 연산량을 크게 줄이면서 배경 보존을 보장할 수 있으며, 이를 통해 NFEs를 100에서 4로 압축한 실시간 성능이 가능해진다.
관련 Figure

이 Figure는 미래 키·값을 제거했을 때 attention 분포가 평탄화되어 인근 프레임에 집중되지 않는 현상을 시각화한다. 해당 관찰은 Teacher Forcing과 chunk-wise causal attention이 필요한 근거로 기능하며 논문에서 제안한 분포 정렬의 동기부여가 된다. 이 시각적 근거는 core_intuition과 methodology에서 다루는 attention distribution shift 주장을 직접 보강한다.
어텐션 분포의 변화 시각화로 bidirectional prior에서는 attention gathering이 나타나고 직접 인과적 절단 시 attention이 넓게 퍼지는 현상이 제시되어 있다.
방법론
전체 접근은 Bidirectional DiT 기반의 Foundation Tuning, chunk-wise Teacher Forcing으로의 구조 정렬, 그리고 DMD 기반의 4-step 생성기 증류로 구성된 세 단계 파이프라인이다. Stage 1에서는 noisy latent zt와 condition latent을 채널 단위로 결합해 full attention으로 편집 매핑을 학습했고 ℒMSE를 최적화해 강력한 offline 편집 prior를 얻었다. Stage 2에서는 causal attention mask Mcausal을 적용해 청크 단위로 인과적 입력만을 허용하고 Teacher Forcing을 통해 causal 출력 분포를 bidirectional 표현에 정렬했다. Stage 3에서는 Stage 2로부터 초기화된 causal 파라미터를 학생 생성기 Gθ의 초기값으로 사용해 DMD를 수행했다. DMD는 frozen Real Score εϕ^{real}과 trainable Fake Score εψ^{fake}의 차이를 이용해 ∇θℒDMD를 계산하고 Gθ를 직접 업데이트한다. 이 과정은 ODE 초기화 없이 4개의 샘플링 스텝으로 생성 과정을 압축하며 ℒMSE와 DMD gradient를 결합해 학습을 안정화했다. 추론 단계에서는 AR-oriented Mask Cache가 동적으로 편집 마스크 Mk를 생성하고 Mk가 1인 위치에만 Full Calculation을 수행한다. Mk는 이전 청크의 z_src와 z_edit의 위치별 L2 거리를 기준으로 임계값 τ를 적용해 생성되며 논문에서는 동적 τ를 통해 약 70%의 토큰을 프루닝한다고 보고했다. 캐시는 Self-Attention 레이어에 적용하며 FFN에 적용할 경우 고주파 정보 손실로 품질이 크게 저하되는 것으로 관찰되었다.
관련 Figure

이 그림은 bidirectional 모델이 정확한 편집을 수행하지만 추론 효율이 낮고 기존 스트리밍 모델이 효율은 높지만 비편집 영역 보존에 실패한다는 특성을 대비시켰다. LiveEdit은 Causal DiT와 마스크 기반 캐시를 결합해 두 문제를 모두 해결하도록 설계되었음이 시각적으로 확인된다. 그림은 본 논문의 전체 설계 방향과 실시간 적용 가능성의 근거를 직관적으로 보완한다.
모델 구조 대비 세 가지 편집 패러다임을 비교한 도식으로 LiveEdit의 Causal DiT와 AR 캐시 조합이 정확한 편집과 효율적 추론을 동시에 달성함을 나타낸다.

그림은 Stage 1의 Foundation Tuning, Stage 2의 Teacher Forcing, Stage 3의 DMD가 어떻게 연계되는지를 청크 단위 흐름으로 보여준다. 또한 오른쪽 패널에서 Token Reuse와 Partial Calculation이 어떻게 동작하는지 구체적 추론 경로를 제공해 methodology의 구현적 세부를 보완한다. 이 다이어그램은 구현자가 각 단계에서 필요한 연산 분기와 캐시 추출 지점을 파악하는 데 실용적이다.
세 단계 증류 파이프라인과 추론 시 AR-oriented Mask Cache의 흐름을 통합한 전체 파이프라인 다이어그램이다.
주요 결과
정량평가는 120쌍의 검증 데이터셋에서 6개 메트릭으로 수행되었다. 캐시 적용 버전은 Text Alignment 0.270, Background Consistency 0.956, Motion Smoothness 0.992를 기록해 Text Alignment와 Motion Smoothness에서 경쟁기법들을 상회했다. 특히 캐시를 적용했을 때 배경 보존은 손상되지 않았고 전반적 화질 지표에서도 우수한 성능을 유지했다. 지연 측면에서 논문은 여러 수치를 보고했다. 요약본에서는 AR 캐시 적용 시 프레임당 79ms의 지연과 12.66 FPS 수준의 실시간 처리 성능을 보고했으며, 세 단계 통합 후 실험 표에서는 81프레임 처리에서 총 7.89초의 지연을 보고했다. 또한 Ablation에서 Self-Attention에 캐시를 적용했을 때가 FFN에 적용했을 때보다 성능이 우수했으며 FFN 캐시는 심각한 품질 악화를 일으켰다. 질적 비교에서 제시된 예시는 기존의 bidirectional 오프라인 편집기가 미래 문맥 의존으로 실시간 적용에 부적합하고 기존 스트리밍 생성기는 편집의 정밀성이나 배경 보존에서 한계를 가졌음을 보여주었다. 반면 본 방법은 텍스트 조건에 맞는 국소적 색·텍스처 변경을 정확히 수행하면서 비편집 영역의 구조와 색 보존을 유지했다.
관련 Figure

이 패널은 기존 오프라인과 스트리밍 기법들이 보이는 색 번짐, 구조 붕괴 등의 오류를 직접적으로 대비시킨다. LiveEdit 결과는 대상 부위의 텍스처와 색을 정확히 바꾸면서 배경의 시간적 일관성을 유지하는 것으로 보인다. 정성적 비교는 정량적 메트릭 결과와 일관되며 편집 정밀도 및 배경 보존 측면의 우수성을 시각적으로 보강한다.
다양한 편집 예시의 정성적 비교로 LucyEdit 등 기존 방법과 LiveEdit의 결과를 나란히 제시하고 있다.

이 그림은 캐시 적용 위치에 따른 시각적 결과 차이를 명확히 드러낸다. SA 캐시는 대상 색 변경을 안정적으로 수행하며 배경 왜곡이 거의 없지만 FFN 캐시는 블러와 구조 왜곡을 유발해 품질이 크게 떨어진다. 이 실험은 캐시를 Self-Attention에 한정한 설계 결정을 정당화한다.
캐시 위치별(없음, SA, FFN) 시간축 결과 비교로 SA 캐시가 품질을 유지하면서 FFN 캐시가 심각한 품질 저하를 일으킨다는 사실을 보여준다.
기술 상세
전체 아키텍처는 Bidirectional DiT 기반의 Foundation 모델과 이를 인과적 실행이 가능한 Causal DiT 학생으로 구성되며 최종적으로 4-step 생성기 Gθ로 증류된다. 입력은 비디오 잠재 시퀀스 z0∈ℝ^{F×C×H×W}와 텍스트 임베딩 c를 사용하며 Stage 1은 채널 단위 concatenation을 통해 noisy latent zt와 condition을 결합해 full temporal attention으로 학습했다. 이 설계는 시퀀스 길이에 따른 attention의 제곱 복잡도를 완화하면서 편집 매핑을 안정적으로 학습하는 역할을 했다. DMD의 수학적 기반은 frozen Real Score εϕ^{real}과 trainable Fake Score εψ^{fake}의 차이에 기반한 gradient 전달이다. 구체적으로 ∇θℒDMD는 zT와 텍스트 조건 c에 대해 w(t)(εϕ^{real}(zt,t,c)−εψ^{fake}(zt,t,c))∇θGθ(zT,c) 꼴로 계산되어 학생 생성기의 파라미터를 업데이트한다. 이 계산은 pruned noise inputs와 함께 작동해 4단계 샘플링으로도 고품질 출력을 달성하게 한다. AR-oriented Mask Cache의 핵심 수식은 Mk_{u,v}=I(‖z_edit,u,v^{k-1}−z_src,u,v^{k-1}‖2>τ)이다. τ는 청크 간 토큰의 redundancy 수준을 기준으로 동적으로 결정되며 본문에서는 전체 토큰의 약 70%를 프루닝하도록 설정했다고 보고되었다. Mk에 따라 활성 영역은 Full Calculation ℱ를 적용하고 비활성 영역은 이전 청크의 캐시된 특징 f^{k-1}_{u,v}를 재사용하는 방식으로 계산 그래프를 동적으로 분기한다. 학습과정은 Wan2.1-T2V-1.3B 기반의 foundation 모델로 시작해 총 데이터셋은 Ditto-1M에서 선별한 약 20K의 고품질 video-to-video 쌍을 사용했다. 학습은 8개의 NVIDIA A100 GPU에서 진행되었고 Stage 1은 9K 스텝, Stage 2는 추가 20K 스텝, Stage 3는 10K 스텝으로 보고되었다. 샘플링 타임스텝은 4-step 생성에서 [0,250,500,750]로 설정되었고 최종 추론은 청크 크기 3 latent 프레임 단위의 autoregressive 모드로 동작한다.
관련 Figure

이 Figure는 Mk 생성 절차와 그 통계적 안정성을 입증하는 근거를 제공한다. 차이 행렬과 최종 마스크가 실제로 정적 배경을 정확히 분리하며 오른쪽 히스토그램의 평균 픽 변화율이 매우 낮음을 통해 구조적 안정성이 확인된다. 이 정량적 근거는 AR-oriented Mask Cache의 실효성과 70% 토큰 프루닝 설정의 타당성을 뒷받침한다.
원본 프레임, 합성 결과, 차이 행렬, 이진 마스크를 시간축 샘플로 보여주며 Temporal IoU와 Pixel Difference 통계 분포를 함께 제시한다.

이 히스토그램은 Self-Attention 표현이 시간적으로 높은 redundancy를 가지는 반면 FFN 표현은 민감하게 변화함을 정량적으로 보여준다. 해당 통계는 Self-Attention 캐시가 품질 손실 없이 재사용 가능한 근거를 제공하며 FFN 캐시의 실패 원인을 수치적으로 뒷받침한다. 따라서 캐시 적용 위치 결정이 데이터 기반으로 이루어졌음을 확인할 수 있다.
연속 denoising 단계 간 토큰 cosine similarity 분포로 Self-Attention 토큰의 평균 유사도가 높고 FFN 토큰의 평균이 낮음을 히스토그램으로 나타낸다.
실무 활용
코드와 결과물이 공개되어 있어 실무 환경에서 실험적 프로토타입으로 적용 가능하다. AR 응용이나 실시간 편집 파이프라인에 통합하면 사용자 상호작용 시 낮은 지연과 엄격한 배경 보존을 동시에 달성할 수 있다. 다만 운영 시에는 모델 크기 및 하드웨어 조건을 고려한 최적화가 필요하다.
- 증강현실 실시간 텍스처 교체 및 의상 변경과 같은 인터랙티브 편집 파이프라인에 적용할 수 있다
- 라이브 스트리밍 환경에서 시청자 지시에 따른 실시간 영상 속성 변경에 활용할 수 있다
- 편집 대상이 국소적일 때 배경의 구조와 색을 유지하며 효율적으로 필터를 적용하는 실시간 영상 필터 서비스에 적용할 수 있다
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Diffusion Transformer (DiT)
- — Diffusion Transformer는 영상 잠재공간에서 노이즈를 소거하는 역확산 과정을 Transformer 구조로 학습한 모델이다. 이 모델은 프레임 간과 프레임 내 토큰들에 대해 공간·시간적 attention을 계산하여 구조적 일관성과 텍스트 조건 정렬을 유지한다. 본문에서는 Bidirectional DiT가 편집 능력의 기반으로 활용되고 Causal DiT로 증류되어 스트리밍 편집에 적용된다.
- Distribution Matching Distillation (DMD)
- — Distribution Matching Distillation은 Real Score 모델과 Fake Score 모델의 점수 차이를 이용해 학생 생성기 Gθ의 파라미터를 기울기 형태로 직접 학습시키는 증류 기법이다. 본문에서는 DMD를 사용하여 생성 과정을 4단계로 압축하고 실시간 응답성을 확보했다. 이 방법은 ODE 초기화 비용을 우회하면서 고품질 편집을 유지하도록 설계되었다.
- AR-oriented Mask Cache
- — AR-oriented Mask Cache는 이전 청크의 원본과 편집 결과 잠재 간 L2 거리를 계산해 편집 활동 마스크를 추출한 뒤, 정적 배경 토큰의 중간 표현을 캐시에서 재사용하는 메커니즘이다. 이 방식은 Self-Attention 계층에서만 토큰을 재활용하여 배경 보존을 보장하면서 계산량을 크게 줄인다. 문서에서는 동적 임계값 τ로 전체 토큰의 약 70%를 프루닝해 지연을 줄였다고 보고되었다.
- Teacher Forcing
- — Teacher Forcing은 사전 학습된 bidirectional 표현을 보존한 채 causal attention 마스크로 제한된 입력에 대해 학생 네트워크가 동일한 출력 분포를 학습하도록 강제하는 학습 전략이다. 본문에서는 chunk-wise causal attention과 결합해 Bidirectional DiT에서 Causal DiT로의 분포 갭을 줄이는 데 사용되었다. 이 단계는 이후의 DMD 초기화를 안정화하는 역할을 수행한다.
- Chunk-wise Causal Attention
- — Chunk-wise Causal Attention은 시간 축을 작은 청크로 나누고 현재 청크와 이전 청크들만 참조하도록 제한한 인과적 어텐션 마스크이다. 이 방식은 미래 프레임 접근 없이 연속 스트리밍 입력을 처리할 수 있게 하며, 모델이 인과적 실행에서 안정적인 구조적 표현을 유지하도록 돕는다. 논문에서는 청크 크기를 3 latent 프레임으로 설정하여 학습과 추론을 진행했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.