본문으로 건너뛰기

VideoFlexTok: 유연한 길이를 가진 조대-미세 비디오 토큰화

기존 비디오 토큰화 방식은 고정된 3D 그리드 구조를 사용하여 영상의 복잡도와 상관없이 방대한 연산량을 요구했습니다. 이 논문은 영상의 핵심 의미부터 세부 디테일까지 단계적으로 압축하는 유연한 토큰화 방식을 제안하여, 훨씬 적은 데이터로도 고품질 비디오를 생성하고 학습 효율을 5배 이상 높였습니다.

왜 중요한가

기존 비디오 토큰화 방식은 고정된 3D 그리드 구조를 사용하여 영상의 복잡도와 상관없이 방대한 연산량을 요구했습니다. 이 논문은 영상의 핵심 의미부터 세부 디테일까지 단계적으로 압축하는 유연한 토큰화 방식을 제안하여, 훨씬 적은 데이터로도 고품질 비디오를 생성하고 학습 효율을 5배 이상 높였습니다.

관련 Figure

VideoFlexTok과 고정 크기 3D 그리드 방식의 토큰 사용량 및 생성 결과 비교 다이어그램
Diagram

VideoFlexTok은 단 1~4개의 토큰만으로도 영상의 핵심 구도와 움직임을 파악할 수 있음을 보여준다. 고정 그리드 방식 대비 8배 적은 토큰으로도 10초 분량의 영상을 성공적으로 생성하는 효율성을 시각화한다.

VideoFlexTok과 고정 크기 3D 그리드 방식의 토큰 사용량 및 생성 결과 비교 다이어그램

핵심 기여

가변 길이 Coarse-to-Fine 토큰 표현

영상을 고정된 그리드가 아닌 가변 길이의 토큰 시퀀스로 표현한다. 초기 토큰은 영상의 전반적인 의미와 움직임을 포착하고, 후속 토큰이 세부적인 시각적 디테일을 추가하는 계층적 구조를 가진다.

Generative Flow Decoder 도입

임의의 토큰 개수로부터 현실적인 비디오를 복원할 수 있는 Rectified Flow 기반 디코더를 설계했다. 이를 통해 하위 작업의 요구 사항이나 계산 예산에 맞춰 토큰 수를 유연하게 조절 가능하다.

학습 및 추론 효율성 극대화

기존 3D 그리드 토크나이저 대비 8배 적은 토큰(672개)만으로 10초 분량의 81프레임 비디오를 생성한다. 동일 성능 기준 5.2B 모델을 1.1B 모델로 대체 가능한 수준의 효율성을 입증했다.

핵심 아이디어 이해하기

기존의 비디오 토크나이저는 영상을 바둑판 모양의 3D 그리드로 나누고 각 칸을 개별 토큰으로 변환한다. 이 방식은 영상이 단순하든 복잡하든 항상 동일한 수의 토큰을 생성하므로, 배경이 정지된 영상에서도 불필요하게 많은 연산 자원을 소모하게 만든다.

VideoFlexTok은 이를 해결하기 위해 '중요한 정보부터 먼저 담는' 전략을 취한다. 먼저 영상의 전체적인 구도나 움직임 같은 핵심 정보를 소수의 토큰에 압축하여 담고(Coarse), 필요에 따라 디테일을 보충하는 토큰을 덧붙이는(Fine) 방식이다. 이는 마치 저해상도 미리보기를 먼저 보여주고 점진적으로 화질을 높이는 스트리밍 방식과 유사하다.

이러한 계층적 구조는 모델이 영상의 본질적인 의미를 더 빨리 파악하게 돕는다. 결과적으로 텍스트-비디오 생성 모델이 학습해야 할 데이터의 양이 획기적으로 줄어들며, 제한된 하드웨어 자원에서도 훨씬 긴 영상을 생성할 수 있는 기반을 마련한다.

관련 Figure

토큰 개수 변화에 따른 비디오 복원 품질의 단계적 변화 예시
Photo

프레임당 토큰 수가 1개에서 256개로 증가함에 따라 영상의 디테일이 점진적으로 정교해지는 과정을 보여준다. 초기 토큰이 객체의 정체성과 움직임을 우선적으로 캡처한다는 것을 증명한다.

토큰 개수 변화에 따른 비디오 복원 품질의 단계적 변화 예시

방법론

VideoFlexTok은 인코더와 디코더로 구성된 오토인코더 구조를 가진다. 인코더는 VAE 잠재 공간(Latent Space) 상의 비디오 데이터를 입력받아 학습 가능한 Register Token들과 인터리빙(Interleaving)한 후, 시간 축에 대한 Causal Attention Mask가 적용된 Transformer를 통과시킨다.

계층적 구조를 형성하기 위해 Nested Dropout 기법을 적용한다. [전체 Register Token 시퀀스 중 무작위로 뒷부분의 토큰들을 제거하는 연산] → [남은 토큰들만으로 영상을 복원하도록 학습] → [앞쪽 토큰들이 영상의 가장 핵심적인 정보를 우선적으로 학습하도록 유도]하는 원리다.

디코더는 Rectified Flow 모델을 사용하여 노이즈가 섞인 잠재 변수로부터 원본 영상을 복원한다. 이때 DINOv2의 특징을 증류(Distillation)하는 REPA Loss를 추가하여 토큰이 시각적 디테일뿐만 아니라 풍부한 의미론적 정보(Semantic Information)를 담도록 강제한다.

관련 Figure

VideoFlexTok의 전체 아키텍처 구조도
Diagram

인코더, Nested Dropout, 디코더로 이어지는 흐름과 REPA Loss를 통한 의미론적 정보 주입 과정을 상세히 설명한다. Time-Causal Attention이 어떻게 적용되는지 구조적으로 보여준다.

VideoFlexTok의 전체 아키텍처 구조도

주요 결과

Kinetics-600 데이터셋 기반의 Class-to-Video 실험에서 VideoFlexTok은 기존 SOTA 모델인 VidTok FSQ나 Cosmos-DV보다 훨씬 적은 토큰으로도 우수한 성능을 보였다. 특히 160개의 토큰만 사용했을 때 rFVD 48.7, gFVD 80.0을 기록하며 효율성을 입증했다.

텍스트-비디오 생성 작업에서는 5.2B 파라미터의 기존 모델과 1.1B 파라미터의 VideoFlexTok 기반 모델이 유사한 수준의 gFVD 및 ViCLIP 점수를 획득했다. 이는 모델 크기를 약 5배 줄이면서도 생성 품질을 유지할 수 있음을 의미한다.

추론 비용 분석 결과, 프레임당 토큰 수를 256개 미만으로 줄이고 Flow 디코더의 Denoising 단계를 늘리는 것이 동일한 연산량 대비 가장 높은 비디오 품질을 제공하는 것으로 나타났다.

관련 Figure

모델 크기 및 학습 토큰 수에 따른 성능 스케일링 그래프
Chart

VideoFlexTok이 기존 3D 그리드 방식보다 훨씬 작은 모델 크기와 적은 학습량으로도 더 높은 정렬(Alignment) 점수를 달성함을 수치적으로 보여준다.

모델 크기 및 학습 토큰 수에 따른 성능 스케일링 그래프

기술 상세

VideoFlexTok의 핵심은 2D 토큰 구조다. 첫 번째 차원은 시간(Time)을 나타내고, 두 번째 차원은 조대-미세(Coarse-to-Fine) 계층을 나타낸다. 인코더와 디코더 모두에 Time-Causal Attention을 적용하여 미래 프레임의 정보 없이 현재까지의 정보만으로 토큰화가 가능하도록 설계되어 스트리밍 처리에 적합하다.

학습 시에는 3D VAE인 VidTok을 기반으로 하며, 16채널의 잠재 공간에서 작동한다. Register Token은 프레임당 최대 256개를 사용하며, FSQ(Finite Scalar Quantization)를 통해 64,000 크기의 코드북으로 이산화한다. REPA(Representation Alignment) 헤드는 디코더의 초기 레이어에서 DINOv2 특징을 예측하도록 하여 토큰의 의미론적 인지 능력을 강화한다.

장기 비디오 생성을 위해 오버랩(Overlap) 프레임을 활용한 조건부 디코딩 전략을 사용한다. 이전 청크에서 생성된 마지막 n개의 프레임을 다음 청크의 조건으로 입력하여 긴 영상에서도 시간적 일관성(Temporal Consistency)을 유지한다.

관련 Figure

첫 번째 토큰의 정보를 분석하기 위한 프롭(Probing) 실험 결과
Photo

첫 프레임을 수정한 후 소수의 토큰만으로 복원했을 때, 원본의 움직임 패턴은 유지하면서 수정된 프레임의 외형을 따르는 것을 확인하여 초기 토큰이 움직임 정보를 주로 담고 있음을 입증한다.

첫 번째 토큰의 정보를 분석하기 위한 프롭(Probing) 실험 결과

한계점

픽셀 단위의 정밀한 복원 지표인 MSE나 MAE 측면에서는 기존의 고정 그리드 방식보다 약간 낮은 성능을 보일 수 있다. 또한 Flow 디코더의 반복적인 Denoising 단계로 인해 추론 시 디코딩 시간이 추가로 소요될 수 있다.

실무 활용

적은 연산 자원으로 고품질 장편 비디오를 생성해야 하는 서비스나 모바일 환경의 온디바이스 AI 모델 개발에 즉시 적용 가능하다.

  • 저사양 GPU 환경에서의 효율적인 텍스트-비디오 생성 모델 학습
  • 실시간 비디오 스트리밍 중 대역폭에 따른 가변 화질 복원 시스템
  • 긴 비디오 시퀀스를 다루는 비디오 이해 및 편집 에이전트 구축

코드 공개 여부: 공개

코드 저장소 보기

키워드

Video Tokenization(비디오 토큰화)Generative Flow Decoder(생성형 플로우 디코더)Coarse-to-Fine(조대-미세 구조)Text-to-Video(텍스트-비디오 생성)Efficiency(효율성)
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 14.수집 2026. 04. 16.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.