본문으로 건너뛰기

OpenCoF-17K과 Wan-CoF: Chain-of-Frame 기반 비디오 추론을 위한 데이터셋과 추론 토큰 설계

OpenCoF-17K로 Wan2.2-I2V-A14B를 LoRA 미세조정한 Wan-CoF는 네 개 외부 벤치마크에서 일관된 성능 향상을 보였고, Visual/Textual Reasoning Tokens는 서로 다른 층·단계에서 중간 추론 상태를 조직하는 역할을 했다.

용어 해설

프레임 연쇄 추론(Chain-of-Frame)
프레임 연쇄 추론은 시계열으로 연결된 영상 프레임 자체에서 단계적 추론 과정을 전개하는 방식으로, 텍스트 기반 Chain-of-Thought와 달리 시각적 상태 변화를 연속적으로 모델이 생성하고 이용하게 한다. 이 접근은 초기 상태와 중간 상태 간 인과·물리적 전개를 모델 내 잠재공간으로 구성해 다단계 추론을 수행하게 하는 것이 핵심이다. 비디오 생성기에서 CoF가 작동하면 긴 시공간 제약 속에서도 물리·논리적 연속성을 유지하는 데 유리하다.
시각적 추론 토큰(Visual Reasoning Tokens (vt))
시각적 추론 토큰은 DiT 계열 비디오 생성기의 시각 토큰 시퀀스에 학습 가능한 보조 토큰을 앞에 붙여 self-attention을 통해 전체 영상 잠재에서 추론 상태를 수집·분배하도록 설계된 메커니즘이다. 이 토큰은 시각 토큰과 양방향 상호작용을 하므로 프레임 간 전역적 계획과 국소적 시각 신호를 결합하여 경로·운동·구조 정보를 내재화한다. 실무에서는 vt가 경계 상태 고정과 최종 결과 결정을 돕는 것으로 관찰되었다.
문자적 추론 토큰(Textual Reasoning Tokens (tt))
문자적 추론 토큰은 텍스트 조건 시퀀스 앞에 학습 가능한 토큰을 추가하여 cross-attention을 통해 시각 생성 과정에 일관된 고수준 프롬프트 우선순위를 제공하는 기법이다. 이 토큰은 prompt-독립적인 키/값 컨텍스트로 동작하여 각 공간 패치와 모든 시간에 동일한 텍스트 기반 규약을 투입한다. 실험에서는 tt가 지시 정렬성 및 구조적 규칙 준수에 특히 유리한 것으로 관찰되었다.
DiT(디퓨전 기반 영상 변환기)(DiT)
DiT는 이미지·비디오 잠재 토큰을 self-attention 블록으로 처리하는 Transformer 기반 디퓨전 백본으로, 토큰 시퀀스 전반에 걸친 공간·시간 정보를 통합하는 구조적 특성을 가진다. 본 논문에서는 DiT 블록의 입력에 reasoning 토큰을 삽입하거나 텍스트 측에 토큰을 추가하는 방식으로 내부 상태를 확장하였다. DiT의 블록 깊이에 따른 역할 분화가 reasoning 토큰의 효과 위치를 결정하는 근거가 된다.
LoRA(저순위 가중치 분해 파인튜닝)(LoRA)
LoRA는 전체 가중치를 직접 업데이트하지 않고 저순위 분해 행렬을 추가로 학습하는 파인튜닝 기법으로, 파라미터·메모리 부담을 크게 줄이면서도 큰 모델을 효율적으로 미세조정할 수 있다. 본 연구에서는 Wan2.2-I2V-A14B에 LoRA로 미세조정을 적용하여 Wan-CoF를 얻었고, 데이터 중심의 효과를 깔끔하게 측정하는 데 활용됐다. LoRA 적용은 제한된 연산 자원에서 데이터 효과를 연구할 때 표준적 선택이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 09.수집 2026. 07. 11.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.