용어 해설
- Diffusion Transformer DiT(Diffusion Transformer (DiT))
- — Diffusion Transformer는 영상 잠재공간에서 노이즈를 소거하는 역확산 과정을 Transformer 구조로 학습한 모델이다. 이 모델은 프레임 간과 프레임 내 토큰들에 대해 공간·시간적 attention을 계산하여 구조적 일관성과 텍스트 조건 정렬을 유지한다. 본문에서는 Bidirectional DiT가 편집 능력의 기반으로 활용되고 Causal DiT로 증류되어 스트리밍 편집에 적용된다.
- 분포 매칭 증류 DMD(Distribution Matching Distillation (DMD))
- — Distribution Matching Distillation은 Real Score 모델과 Fake Score 모델의 점수 차이를 이용해 학생 생성기 Gθ의 파라미터를 기울기 형태로 직접 학습시키는 증류 기법이다. 본문에서는 DMD를 사용하여 생성 과정을 4단계로 압축하고 실시간 응답성을 확보했다. 이 방법은 ODE 초기화 비용을 우회하면서 고품질 편집을 유지하도록 설계되었다.
- AR 지향 마스크 캐시(AR-oriented Mask Cache)
- — AR-oriented Mask Cache는 이전 청크의 원본과 편집 결과 잠재 간 L2 거리를 계산해 편집 활동 마스크를 추출한 뒤, 정적 배경 토큰의 중간 표현을 캐시에서 재사용하는 메커니즘이다. 이 방식은 Self-Attention 계층에서만 토큰을 재활용하여 배경 보존을 보장하면서 계산량을 크게 줄인다. 문서에서는 동적 임계값 τ로 전체 토큰의 약 70%를 프루닝해 지연을 줄였다고 보고되었다.
- Teacher Forcing
- — Teacher Forcing은 사전 학습된 bidirectional 표현을 보존한 채 causal attention 마스크로 제한된 입력에 대해 학생 네트워크가 동일한 출력 분포를 학습하도록 강제하는 학습 전략이다. 본문에서는 chunk-wise causal attention과 결합해 Bidirectional DiT에서 Causal DiT로의 분포 갭을 줄이는 데 사용되었다. 이 단계는 이후의 DMD 초기화를 안정화하는 역할을 수행한다.
- 청크 단위 인과적 어텐션(Chunk-wise Causal Attention)
- — Chunk-wise Causal Attention은 시간 축을 작은 청크로 나누고 현재 청크와 이전 청크들만 참조하도록 제한한 인과적 어텐션 마스크이다. 이 방식은 미래 프레임 접근 없이 연속 스트리밍 입력을 처리할 수 있게 하며, 모델이 인과적 실행에서 안정적인 구조적 표현을 유지하도록 돕는다. 논문에서는 청크 크기를 3 latent 프레임으로 설정하여 학습과 추론을 진행했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.






