본문으로 건너뛰기

PackForcing: 긴 비디오 샘플링과 긴 컨텍스트 추론을 위한 짧은 비디오 학습의 충분성

기존 비디오 생성 모델은 영상이 길어질수록 메모리 사용량이 급격히 늘어나고 내용이 반복되는 한계가 있었다. 이 논문은 과거 정보를 세 가지 유형으로 나누어 효율적으로 압축 관리함으로써, 일반 GPU 한 장으로도 일관성 있는 2분 길이의 영상을 만들 수 있게 한다.

용어 해설

키-값 캐시(KV-cache)
Transformer 모델에서 이전 단계의 계산 결과를 저장해 재사용하는 메모리 영역이다. 비디오 생성 시 과거 프레임 정보를 담고 있어 일관성 유지에 필수적이지만, 영상이 길어질수록 용량이 선형적으로 증가하여 메모리 부족 문제를 야기한다.
회전 위치 임베딩(RoPE)
토큰의 상대적 위치 정보를 회전 행렬을 통해 주입하는 기법이다. PackForcing에서는 토큰 삭제 후 발생하는 위치 불연속성을 해결하기 위해 이 회전 값을 미세하게 조정하여 전체 캐시 재계산 없이 위치 연속성을 유지한다.
자기회귀 모델(Autoregressive Model)
과거의 데이터를 바탕으로 다음 데이터를 순차적으로 예측하는 모델이다. 비디오 생성에서는 이전 프레임들을 참고하여 다음 프레임을 한 블록씩 만들어가는 방식을 의미하며, 장기 생성 시 오차 누적 문제가 발생하기 쉽다.
3D 컨볼루션(3D Convolution)
가로, 세로 공간 정보뿐만 아니라 시간 축까지 동시에 연산하는 필터 기술이다. 영상의 연속적인 움직임과 공간적 특징을 한꺼번에 추출하고 압축하는 데 효과적이며, PackForcing의 고해상도 압축 브랜치에서 핵심 역할을 한다.
변이형 오토인코더(VAE)
데이터를 저차원의 잠재 공간으로 압축했다가 다시 복원하는 신경망이다. 이 논문에서는 영상의 전체적인 의미를 유지하면서 데이터 크기를 줄이는 재인코딩 과정에 활용되어 중간 이력 토큰의 효율적인 보존을 돕는다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 27.수집 2026. 03. 31.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.