TL;DR
긴 시퀀스 생성에서 모델이 자체 생성 히스토리를 캐시에 기록하는 방식은 추후 프레임의 품질과 일관성을 좌우한다. 기존의 Self Forcing은 롤아웃 히스토리를 사용하되 해당 히스토리를 쓰는 연산에 대해 이후 손실이 신호를 주지 않아 시간이 지남에 따라 정체성·레이아웃·뷰포인트가 붕괴하는 문제가 발생했다. SGF는 이 누락된 학습 신호를 복원해 짧은 학습 윈도우로도 분 단위까지 자연스러운 외삽을 가능하게 했다는 점에서 실용적 의미가 크다.
왜 중요한가
긴 시퀀스 생성에서 모델이 자체 생성 히스토리를 캐시에 기록하는 방식은 추후 프레임의 품질과 일관성을 좌우한다. 기존의 Self Forcing은 롤아웃 히스토리를 사용하되 해당 히스토리를 쓰는 연산에 대해 이후 손실이 신호를 주지 않아 시간이 지남에 따라 정체성·레이아웃·뷰포인트가 붕괴하는 문제가 발생했다. SGF는 이 누락된 학습 신호를 복원해 짧은 학습 윈도우로도 분 단위까지 자연스러운 외삽을 가능하게 했다는 점에서 실용적 의미가 크다.
핵심 기여
히스토리 캐시 쓰기에서 발생하는 컨텍스트-그래디언트 갭 규명
Self Forcing가 자체 롤아웃 히스토리를 읽는 측면에서는 손실을 수신하지만, 클린-타임스텝에서 해당 히스토리를 KV로 인코딩하는 쓰기 연산에는 미래 손실이 전파되지 않아 학습 신호가 사라진다는 점을 명확하게 규정했다. 이 현상은 동일한 DiT 매개변수가 노이즈 단계 손실로 갱신되면서 과거의 쓰기 연산이 목표와 어긋나게 변화할 수 있음을 수학적으로 보여주었다. 갭의 존재는 긴 외삽에서 정체성·뷰포인트·레이아웃 붕괴로 연결된다고 실험적으로 확인했다.
두 패스 병렬 재구성으로 컨텍스트 쓰기 그래디언트를 복원하는 SGF 알고리듬 도입
롤아웃을 그래디언트 없이 수행해 기록된 노이즈 입력과 클린 컨텍스트 라텐트를 수집하는 Pass 1과, 그 상태를 고정 입력으로 재인코딩해 컨텍스트 K/V 경로를 미분 가능하게 하는 병렬 Pass 2로 구성된 학습 절차를 도입했다. 이 구조는 전체 시리얼 롤아웃에 대해 BPTT를 유지하지 않으면서 미래 손실이 클린-타임스텝 쓰기 연산에 기여하도록 경로를 복원한다. 설계상 Pass 1은 무그래디언트이고 Pass 2는 고정-윈도우 재구성만 수행해 메모리 폭발을 피했다.
광범위한 초기화·프레임/청크 실험에서 긴 외삽 품질 및 인간 선호도 향상 검증
5초 학습 윈도우로 훈련한 모델을 60초와 240초로 외삽한 실험에서 SGF는 Self Forcing에 비해 aesthetic, background consistency, imaging quality, motion smoothness, subject consistency, flickering 등 주요 자동 지표에서 일관된 개선을 보였다. GSB 사람 선호도 실험에서도 모든 비교 설정에서 SGF 쪽 선호도가 양수로 집계되어 인간 관점 품질 향상을 뒷받침했다. 또한 직접 미분 가능한 캐시 방식은 메모리 부족으로 실패하는 반면 SGF는 제한된 오버헤드로 학습이 가능했다.
핵심 아이디어 이해하기
Autoregressive 비디오 확산 모델은 각 블록의 예측이 이전 블록들이 캐시한 KV 표현을 읽음으로써 시간적 연속성을 확보한다. 이때 클린-타임스텝에서 생성된 라텐트는 K/V로 투영되어 캐시에 추가되고, 이후 블록들은 이 K/V를 고정된 상태로 읽는다. 따라서 이후 단계의 손실이 클린-타임스텝의 '무엇을 어떻게 캐시에 썼는지'에 대한 지침을 제공하지 못하면, 시간이 지남에 따라 캐시에 기록되는 표현이 장기 예측에 적합하지 않게 변할 우려가 있다.
방법론
SGF는 두 단계로 작동해 누락된 경로를 복원한다. 첫 번째 단계는 완전한 시리얼 롤아웃을 수행하되 모든 연산에서 그래디언트를 비활성화하고, 미리 샘플한 디노이징 종료 단계(exit step)에서의 노이즈 입력(z^{t*})과 예측된 클린 라텐트(\tilde{x})를 기록한다. 두 번째 단계는 기록된 클린 라텐트를 stop-gradient 입력으로 고정한 채 동일한 클린-타임스텝 연산을 병렬로 재계산하고, 이 재계산 과정에서 생성되는 K/V 프로젝션과 미래-컨텍스트 어텐션 경로에 대해 그래디언트를 허용한다. 이로써 미래 DMD 손실이 재계산된 컨텍스트 K/V에 기여하면서 클린-타임스텝 쓰기 연산의 파라미터를 직접 업데이트할 수 있게 된다.
관련 Figure

이 그림은 Pass 1에서 기록된 클린 라텐트와 노이즈 입력이 Pass 2의 재구성 입력으로 사용되어 컨텍스트 K/V 경로에 그래디언트가 전달되는 구조를 명확하게 제시한다. 또한 frozen-cache Self Forcing 대비 SGF가 어떻게 재구성 단계에서 K/V 쓰기 경로를 미분 가능하게 만들어 미래 손실이 클린-타임스텝 쓰기 연산을 학습하도록 연결하는지를 구조적으로 보여준다.
SGF의 전체 흐름을 보여주는 다이어그램으로, no-gradient self-rollout과 parallel context-gradient reconstruction의 관계 및 Pass 1·Pass 2의 경계가 시각화되어 있다.
주요 결과
자동 지표 결과에서 SGF는 5초 단기 설정에서는 Self Forcing과 대체로 동등한 성능을 보였으나 60초와 240초 장기 외삽에서 여러 지표에서 개선을 보였다. 예컨대 프레임 단위 240초 TF 초기화 실험에서 Subject consistency와 Flickering 등 일관성 관련 지표에서 SGF가 더 높은 값을 기록했고(표 데이터가 논문 본문에 제시된 값을 따름), GSB 인간 선호도에서는 프레임·청크 설정 전반에서 SGF 쪽을 더 선호하는 결과가 보고됐다. 학습 비용 측면에서는 peak memory가 79.01GB에서 87.01GB로 증가했고 5-step 당 시간은 10.39s에서 11.71s로 증가했으나 직접 미분 가능한 캐시 방식은 OOM으로 실패해 실용적 대안으로 SGF의 효율성이 입증되었다.
관련 Figure

이 이미지는 장기 외삽에서 Self Forcing이 누적되는 정체성·레이아웃 붕괴를 보이는 반면 SGF는 주체의 정체성 유지와 배경 일관성 보존에서 개선을 보인다는 주장을 시각적으로 보완한다. 여러 시점(예: 0s, 48s, …, 240s)을 제시해 시간이 지남에 따라 발생하는 드리프트와 SGF의 안정성 차이를 직관적으로 확인하게 한다.
프레임별 비교 예시를 나란히 배치한 결과 이미지로, 동일 프롬프트·초기화 하에서 Self Forcing과 SGF의 시간 경과에 따른 시각적 차이를 보여준다.
기술 상세
전체 아키텍처는 causal DiT(denoising transformer)와 시리얼 KV 캐시를 사용하는 autoregressive 비디오 확산 프레임워크 위에 구축되었다. Pass 1에서는 각 블록의 클린-타임스텝 출력을 C_theta(\tilde{x}i, t_ctx; KV{<i}^0)로 투영해 KV_i^0를 생성하는 전형적 캐시 쓰기 연산이 실행되며, 이 과정은 그래디언트가 비활성화된 상태로 수행된다. 수식적으로 캐시 쓰기는 다음과 같이 표현된다: KV_i^0(θ) = C_θ(\tilde{x}i, t_ctx; KV{<i}^0), 여기서 \tilde{x}i는 샘플된 exit-step의 예측 클린 라텐트이고 KV{<i}^0는 이전에 기록된 캐시들이다. 이 연산의 출력이 이후 블록들의 조건부 입력으로 작용하므로 미래 손실이 이 연산의 파라미터에 기여하도록 만드는 것이 목표이다.
한계점
논문은 SGF가 직접 미분 가능한 시리얼 캐시 방식이 직면한 메모리 폭발 문제를 피하는 대신 피크 메모리와 계산 비용이 소폭 증가한다고 명시했다. 재구성 패스에서 수치적·구현적 차이로 인해 완전한 복원이 항상 정확히 일치하지 않을 수 있음을 논문이 확인했으며, 이러한 복구 정확도는 구현 세부와 부동소수점 처리에 민감하다. 또한 논문에서는 SGF를 더 강력한 초기화, 장기 컨텍스트 튜닝, 검색 기반 보조 기억 장치와 결합하는 후속 연구가 필요하다고 명시했다.
실무 활용
SGF는 기존 Self Forcing 파이프라인 위에 상대적으로 적은 구현 변경으로 적용할 수 있으며, 실제로 공개된 GitHub 저장소에서 코드가 제공되어 재현이 가능하다. Pass 1의 기록과 Pass 2의 병렬 재구성 인터페이스를 제공하는 DiT 구현이 필요하며, 메모리 최적화를 위해 블록-스파스 정적 마스크를 지원하는 FlexAttention 같은 효율적 어텐션 구현이 권장된다.
- 단기간(예: 5초)으로 훈련한 모델의 분 단위 외삽 성능을 개선하는 장기 비디오 생성 파이프라인에 적용할 수 있다.
- 생성된 인물의 정체성 유지, 배경·레이아웃 일관성 및 카메라 관계 보존이 중요한 영상 합성·후처리 작업에 적용 가능하다.
- 스트리밍 환경에서 sink+FIFO 정책을 유지하면서 장기 안정성을 확보해야 하는 실시간 비디오 생성 서비스에 활용될 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- KV Cache
- — Transformer 기반 생성기에서 이전 타임스텝의 히든 상태를 키(key)와 값(value) 쌍으로 저장해 이후 토큰들의 어텐션 입력으로 재사용하는 메커니즘이다. 각 새 프레임의 클린-타임스텝 출력은 프로젝션을 거쳐 KV 엔트리로 변환되어 캐시에 추가되며, 이후 블록들은 이 캐시를 읽어 과거 정보를 재활용한다. 이 저장-재사용 과정이 긴 시퀀스에서 메모리·일관성 유지의 핵심 역할을 한다.
- Causal Attention
- — 시간 순서에 따라 미래 정보를 참조하지 않도록 마스킹된 어텐션 방식으로, autoregressive 생성에서 이전 토큰들만 현재 토큰의 예측에 기여하도록 보장한다. 비디오 생성에서는 과거 프레임의 KV 표현만 현재 블록이 읽도록 하여 생성의 인과성을 유지한다. 이 특성 때문에 과거에 기록된 KV의 쓰기 연산이 이후 예측에 미치는 영향이 중요해진다.
- Self Rollout
- — 학습 시 모델이 실제 추론과 동일하게 이전에 모델이 생성한 프레임들을 입력으로 사용해 순차적으로 생성하는 절차이다. Teacher-Forcing과 달리 지상 정답이 아닌 자체 생성 히스토리를 기반으로 학습하여 노출 바이어스(exposure bias)를 줄이는 목적을 가진다. 그러나 롤아웃 과정에서 생성된 KV를 고정하면 이후 손실이 이 KV의 생성 경로를 교정하지 못하는 문제가 발생할 수 있다.
- Distribution-Matching Distillation
- — 양방향 또는 강력한 교사 모델이 생성한 분포와 자기회귀 학생의 예측 분포 사이의 차이를 측정하고 이를 최소화하는 증류 목적이다. 비디오 forcing 환경에서는 몇 단계의 디노이징 출력에 대해 교사와 학생의 분포를 정렬해 학생이 더 나은 타깃 예측을 하게 만든다. SGF에서는 이 손실이 미래 타깃에 대해 캐시 쓰기 경로까지 학습 신호를 전달하도록 복원되는 것이 핵심이다.
코드 예제
loop
Initialize serial cache KV ← [ ] and records Z*, X_ctx ← [ ]
Sample exit index s ∼ Uniform{1,…,K} and set t* ← t_s
Pass 1: no-gradient self-rollout
Disable gradient computation for all Pass-1 operations
for block i = 1,…,N do
for denoising step k = 1,…,s do
x_hat_i^(k) ← G_theta(z_i^{t_k}; t_k, KV)
if k < s then sample ε and set z_i^{t_{k+1}} ← Ψ(x_hat_i^(k), ε, t_{k+1}) end if
end for
Record Z_i^* ← z_i^{t*} and x~_i ← x_hat_i^(s)
KV ← KV ∪ C_theta(x~_i, t_ctx; KV)
Append x~_i to X_ctx and Z_i^* to Z*
end for
Pass 2: parallel context-gradient reconstruction
X_rec ← stop_gradient(X_ctx)
Enable gradient computation
X_hat_tar ← G_theta(Z*, t*; X_rec, t_ctx, M_rec)
Update theta with L_DMD(X_hat_tar) keeping context-K/V gradients
end loop이 의사코드는 SGF의 핵심 루프를 요약한 것으로, Pass 1에서 그래디언트를 비활성화한 채로 자체 롤아웃과 클린-컨텍스트 기록을 수행하고 Pass 2에서 기록된 노이즈 입력과 컨텍스트를 재입력해 컨텍스트 K/V 경로에 대해 그래디언트를 허용해 파라미터를 갱신하는 과정을 보여준다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.