TL;DR
비전-언어 모델의 추론 능력은 단일 이미지나 텍스트로는 포착하기 어려운 시간적 인과와 다단계 결론을 요구한다. 이 논문은 비디오 생성 자체를 추론 매체로 삼는 Chain-of-Frame 접근을 실험적으로 강화하여, 시각적 상태의 시간적 전개를 모델 내부에서 직접 학습시키는 방향을 제시했다. 따라서 영상 생성기 기반의 추론 역량을 체계적으로 개선하고 외부 벤치마크로의 전이 가능성까지 입증한 점이 중요하다.
왜 중요한가
비전-언어 모델의 추론 능력은 단일 이미지나 텍스트로는 포착하기 어려운 시간적 인과와 다단계 결론을 요구한다. 이 논문은 비디오 생성 자체를 추론 매체로 삼는 Chain-of-Frame 접근을 실험적으로 강화하여, 시각적 상태의 시간적 전개를 모델 내부에서 직접 학습시키는 방향을 제시했다. 따라서 영상 생성기 기반의 추론 역량을 체계적으로 개선하고 외부 벤치마크로의 전이 가능성까지 입증한 점이 중요하다.
핵심 기여
OpenCoF-17K 데이터셋 구축
OpenCoF-17K은 11개 과제군에 걸쳐 17,312개의 조건부 비디오 샘플을 수집하여 표준 해상도(480p), 15fps, 81프레임으로 통일한 데이터셋이다. 데이터는 인스턴스 기반 렌더링, 전문가 가이드 렌더링, 절차적 장면 합성, 외부 비디오 재활용의 네 가지 파이프라인으로 제작되어 다양한 시간적 감독 신호를 포함한다. 특히 VBVR의 30개 세부과제를 포함해 구조적·물리적·알고리즘적 과제를 고루 포함한다.
데이터 중심 미세조정으로 얻은 Wan-CoF
Wan2.2-I2V-A14B를 OpenCoF-17K로 LoRA 미세조정하여 Wan-CoF를 얻었고, 네 개의 외부 비디오 추론 벤치마크에서 전반적 향상을 확인했다. 구체적으로 MME-CoF의 Overall은 1.00에서 1.30으로, Gen-ViRe 평균은 0.304에서 0.391로, VIPER POC는 3.3에서 7.5로, RULER-Bench 전체 평균은 55.8에서 56.8로 상승했다. 이러한 향상은 시각적 품질 개선보다 시간적·물리적·논리적 추론 하위차원에서 집중적으로 나타났다.
Visual 및 Textual Reasoning Tokens 설계
Visual Reasoning Tokens(vt)는 DiT의 시각 토큰 시퀀스 앞에 학습 가능한 N_r 토큰을 추가하고 self-attention을 통해 양방향으로 시각 잠재와 상호작용하도록 구성되며, Textual Reasoning Tokens(tt)는 텍스트 컨디셔닝 앞에 N_t 토큰을 추가하여 cross-attention을 통해 일방향적 프롬프트 우선권을 제공한다. vt는 경계 상태와 전역 계획에 유리하고 tt는 지시 정렬성·구조 규칙 준수에 유리한 특성을 보였다. 두 토큰은 별도 실험에서 서로 다른 벤치마크 하위지표를 향상시키며 상보적 역할을 드러냈다.
심층적 어텐션 기반 동작 관찰
120개 MME-CoF 사례에서 추출한 어텐션을 블록 깊이, 디노이징 단계, 공간·시간 위치 축으로 집계하여 vt와 tt의 사용 시점과 영역을 규명했다. vt는 저-중간 블록과 디노이징 초기에 높은 참여를 보였고 프레임의 시작·끝 경계에 더 민감한 반면, tt는 초기에서 중간 블록 전반에 걸쳐 꾸준히 작용하며 프롬프트 수준의 제약을 유지했다. 이 관찰은 토큰 설계의 기능적 차이를 이해하고 향후 결합 전략을 설계할 근거를 제공한다.
핵심 아이디어 이해하기
비디오 생성 모델은 프레임 간 시간적 전개를 자연스럽게 모델링하므로, 시각적 변화를 통해 단계적 추론을 전개하는 Chain-of-Frame이 가능한 출발점이 된다. 기존 CoT 접근은 정적 이미지나 텍스트 수열에 의존해 시간적 인과를 직접 표현하지 못했고, 그 결과 긴 시공간적 일관성이나 물리적 연속성이 약한 한계가 있었다. 따라서 비디오 생성기를 추론 매체로 삼으면 상태 전이 자체를 학습 신호로 활용할 수 있다. OpenCoF-17K는 다양한 시간적 감독을 제공하여 모델이 초기 상태에서 중간 계획을 거쳐 최종 상태로 이어지는 규칙과 물리 법칙을 학습하도록 한다. 데이터 파이프라인은 규칙 기반 퍼즐, 기하학적 보조선, 절차적 물리 시뮬레이션, 외부 고품질 시연의 네 가지를 혼합함으로써 알고리즘적·공간적·물리적 추론 신호를 함께 제공한다. 이로 인해 단일 도메인 편향을 줄이고 외부 벤치마크로의 전이 가능성을 확보한다. Visual Reasoning Tokens는 시각 잠재 내부에 직접 추론 상태를 유지할 수 있는 공간을 만들고, Textual Reasoning Tokens는 텍스트 조건에 일관된 추론 우선권을 추가함으로써 서로 다른 수준의 추론 정보를 분리 저장한다. vt는 self-attention을 통해 시각 전체에서 정보를 집계하고 다시 분배하므로 경계 상태나 전역 계획을 내장하기에 적합하다. tt는 cross-attention을 통한 정적 키/값 컨텍스트로 동작해 프롬프트 독립적인 규약을 전 시간에 걸쳐 공급함으로써 구조적 규칙과 지시 정렬성에 유리하다.
관련 Figure

왼쪽 패널은 vt가 시각 토큰 시퀀스에 삽입되어 self-attention을 통해 시각 잠재와 양방향 상호작용을 한다는 점을, 오른쪽 패널은 tt가 텍스트 시퀀스에 추가되어 cross-attention을 통해 시각 토큰에 일방향 우선권을 제공한다는 점을 명확히 나타낸다. 이 도식은 두 토큰의 작동 원리와 블록 단위로의 삽입 위치를 직관적으로 파악하게 하며 기술적 구현의 핵심 설계 선택을 시각적 증거로 제시한다.
논문에서 제안한 Visual과 Textual Reasoning Tokens의 아키텍처적 위치와 흐름을 비교한 그림이다.
방법론
데이터 측면에서 OpenCoF-17K는 11개 과제군, 총 17,312개의 조건-비디오 쌍으로 구성되며 모든 샘플은 480p·15fps·81프레임으로 표준화되었다. 데이터 수집은 인스턴스 기반 렌더링, 전문가 가이드 렌더링, 절차적 장면 합성, 외부 비디오 재활용의 네 파이프라인을 병행하여 다양한 감독 신호를 확보했다. 이 설계는 퍼즐·기하학·물리·로봇 조작 등 서로 다른 추론 유형을 포함해 모델이 광범위한 시간적 패턴을 학습하도록 의도되었다. 모델 측면에서는 Wan2.2-I2V-A14B를 기본 백본으로 사용하고 LoRA로 파인튜닝하여 Wan-CoF를 획득했다. 학습 설정은 데이터 중심 실험을 분리 측정하기 위해 다른 추론 전용 구조를 일단 도입하지 않은 데이터 전용 단계와, 이후 vt·tt를 각각 도입하는 탐색 단계로 나뉜다. vt는 DiT 시각 토큰 시퀀스 앞에 N_r개의 학습 가능 벡터를 prepend하여 z0 = [r^v_1, ..., r^v_Nr, x_1, ..., x_M] 형태로 입력하고, tt는 텍스트 시퀀스 앞에 N_t개의 토큰을 prepend하여 c0 = [r^t_1, ..., r^t_Nt, c_1, ..., c_L] 형태로 입력한다. 훈련은 LoRA 파라미터만 업데이트하는 방식으로 수행되어 원본 가중치는 유지되며, 평가 시에는 vt는 최종 출력 전에 폐기되고 tt는 텍스트 컨텍스트로 유지된다. 성능 평가는 네 개의 독립적 외부 벤치마크(MME-CoF, Gen-ViRe, VIPER, RULER-Bench)를 사용하여 데이터 전용 효과와 토큰 설계의 일반화 성능을 분리 측정했다. 추가로 120개 사례를 사용한 어텐션 집계로 토큰의 활용 시공간적 패턴을 추적했다.
관련 Figure

이 그림은 인스턴스 기반 렌더링, 전문가 유도 렌더링, 절차적 합성, 외부 영상 재활용의 네 가지 파이프라인으로 데이터가 수집되어 합쳐졌음을 나타낸다. 각각의 파이프라인이 담당하는 과제 유형(예: 체스·수도쿠·물리 모션·로봇 조작)이 시각적으로 배치되어 데이터 다양성의 설계적 근거를 제공한다. 데이터 수집의 다중 경로가 특정 추론 유형과 어떻게 매핑되는지 이해하는 데 직접적인 근거가 된다.
OpenCoF-17K의 구성과 네 가지 데이터 수집 파이프라인을 개관하는 도식이다.

도표는 전체 17,312개 샘플 중 VBVR 계열이 약 44.8%를 차지하고 나머지 과제들이 비교적 균등하게 분포함을 나타낸다. 표기된 개별 수치(예: Chess 1,000, 2D geometry 1,162 등)는 데이터 스케일과 특정 과제의 상대적 비중을 정량적으로 제시하여 학습 전반의 편향성을 판단하는 근거로 활용된다. 이 통계는 데이터 편중이 결과 전이성에 미친 영향을 해석할 때 참조점이 된다.
OpenCoF-17K의 과제별 샘플 수와 비중을 도넛 차트로 요약한 통계 시각화이다.

각 파이프라인의 처리 흐름이 예시 이미지와 함께 단계별로 배열되어 있어 실제 구현에서 어떤 자산이 코드 렌더링으로 동영상으로 변환되는지가 드러난다. Chess나 Sudoku 같은 구조적 자산이 어떻게 코드 렌더링을 통해 프레임 시퀀스가 되는지, 전문가 가이드가 좌표·보조선 등을 어떻게 생성하는지에 대한 구현적 단서를 제공한다. 이 그림은 데이터 제작의 결정적 절차와 자동화 정도를 판단하는 데 실무적 근거로 활용된다.
세 가지 데이터 파이프라인(인스턴스 기반·전문가 가이드·절차적 합성)의 입력-처리-렌더링 흐름을 보여주는 도식이다.

각 과제별로 샘플 프레임들이 세 장씩 배열되어 데이터의 다양성과 표준화된 포맷(초기 이미지, 텍스트 프롬프트, 샘플 프레임)이 어떻게 구성되는지를 확인할 수 있다. 퍼즐·기하·물리·로봇 등 다양한 과제가 포함되어 있어 특정 과제 유형이 학습 신호로 어떻게 제공되는지 직관적 근거를 제공한다. 연구자가 과제별 난이도와 시각적 복잡도를 비교하는 데 유용하다.
여러 과제의 예시 프레임을 모아 OpenCoF-17K의 대표 사례를 보여주는 Figure이다.
주요 결과
데이터 전용 미세조정만으로 Wan-CoF는 모든 외부 벤치마크의 헤드라인 지표를 향상시켰다. 구체적으로 MME-CoF Overall은 1.00에서 1.30으로(+0.30), Gen-ViRe 평균은 0.304에서 0.391로(+0.087), VIPER POC는 3.3에서 7.5로(+4.2), RULER-Bench 전체 평균은 55.8에서 56.8로(+1.0) 상승했다. 향상 폭은 물리·시간적·알고리즘적 하위지표에서 더 뚜렷하여 시각적 품질 자체보다는 프레임 수준의 추론 개선이 주요 원인으로 나타났다. vt와 tt의 도입은 Wan-CoF 위에서 추가 개선을 낳았고 두 설계는 하위지표에서 서로 다른 강점을 보였다. Wan-CoF vt는 Gen-ViRe와 RULER-Bench에서 가장 높은 집계 점수를 기록했고 구체적으로 Planning·Abstract·Analogy 같은 전역 계획 관련 지표에서 우세했다. Wan-CoF tt는 MME-CoF와 VIPER에서 더 큰 개선을 보였고 Instruction Alignment나 구조적 규칙 준수와 연관된 지표에서 상대적 이득이 컸다. 어텐션 집계 결과는 토큰 사용의 시공간적 차이를 뒷받침한다. vt는 블록 깊이의 특정 구간과 디노이징 초기에 더 높은 self-attention 기여를 보였고 프레임의 처음과 끝에서 특히 활성화되는 경향이 있었다. tt는 초기-중간 블록에서 부드럽게 작동하며 cross-attention을 통해 전 시간에 걸친 프롬프트 수준 제약을 공급하는 역할이 관찰되었다.
관련 Figure

그래프는 vt와 tt의 어텐션 참여가 DiT 블록 깊이와 디노이징 스텝에서 비균일하게 분포함을 수치로 제시한다. vt는 저-중간 블록과 디노이징 초기에 더 높은 값이 관찰되고 tt는 초기부터 중간 블록에 걸쳐 부드러운 곡선을 보이는 등 두 토큰의 시기적 역할 분화가 뚜렷하다. 이 수치적 시각화는 토큰이 모델 내부에서 언제 중요하게 활용되는지를 근거로 제공한다.
Depth와 디노이징 단계에 따른 vt 및 tt에 대한 평균 어텐션 스코어를 시계열로 그린 그래프이다.
기술 상세
전체 아키텍처는 DiT 기반의 비디오 생성 백본을 사용하며 입력은 시각 토큰 x ∈ ℝ^{T×H×W×d}와 텍스트 컨디셔닝 c ∈ ℝ^{L×d}로 구성된다. Visual Reasoning Tokens는 N_r개의 학습 가능 벡터 r^v ∈ ℝ^{N_r×d}을 시각 토큰 앞에 붙여 z_0 = [r^v_1, ..., r^v_{N_r}, x_1, ..., x_M]로 DiT 블록에 공급한다. 이때 M = T×H×W이며 self-attention은 각 시각 토큰이 모든 r^v를 참조하고 r^v도 전체 시각 시퀀스와 상호작용하게 하여 양방향 정보 흐름을 형성한다. Textual Reasoning Tokens는 N_t개의 토큰 r^t ∈ ℝ^{N_t×d}을 텍스트 시퀀스 앞에 prepend하여 c_0 = [r^t_1, ..., r^t_{N_t}, c_1, ..., c_L]로 cross-attention에 투입한다. 여기서 r^t는 key/value로만 작동하고 query에는 포함되지 않아 시각 시퀀스에 대해 일관된 텍스트 기반 우선순위를 제공한다. 이 차이는 vt가 시각적 상태를 갱신하는 양방향 채널로 작동하고 tt는 프롬프트 수준의 정적 채널로 작동한다는 설계 의도를 수학적으로 뒷받침한다. 훈련은 LoRA 파라미터만 업데이트하는 방식으로 수행되어 원본 가중치는 고정된 상태로 유지되며, LoRA의 저순위 행렬이 추론 토큰과 결합된 표현을 학습하여 파라미터 효율적인 미세조정을 가능하게 했다. 평가 시에는 vt는 최종 예측 전에 폐기되며 tt는 텍스트 컨텍스트로 유지된다는 동작 규약을 사용했다. 어텐션 측정은 120개 사례를 표본으로 각 DiT 블록과 디노이징 단계에서 visual→vt self-attention과 visual→tt cross-attention 평균을 계산하는 방식으로 수행되었다. 수치 예시로는 데이터 전용 미세조정 결과 MME-CoF Overall이 1.00에서 1.30으로 0.30 증가한 점이 있다. 이 수치는 동일 백본에 LoRA 미세조정만 적용했을 때 데이터 효과로 인한 성능 향상을 수치적으로 분리한 근거가 된다. 또한 Gen-ViRe에서 Wan-CoF vt는 평균 0.441을 기록해 vt의 전역적 계획 보조 효과가 수치화되었다.
관련 Figure

공간 맵은 vt가 국소적 축(가로·세로 띠 형태)에 더 집중되고 tt는 넓은 영역에 걸쳐 분포하는 차이를 나타낸다. 시간 맵은 vt가 시퀀스의 시작과 끝 경계에서 두드러지는 반면 tt는 중간 이후 전반에 걸쳐 지속적으로 활성화되는 경향을 보여 토큰의 기능적 분담을 뒷받침한다. 이러한 시공간적 패턴은 vt가 경계 상태 고정과 결말 예측에, tt가 전체 과정 제약에 기여함을 실증적으로 지지한다.
공간 및 시간 축에서 vt와 tt의 어텐션 맵을 사례별로 시각화한 이미지이다.
한계점
논문에서 명시적으로 지적한 한계는 vt와 tt를 별도로 실험했으며 두 메커니즘의 결합 효과는 평가되지 않았다는 점이다. 이로 인해 상호작용 효과나 충돌 상황에서의 거동이 불명확하며, 두 토큰을 동시에 운영할 때의 학습 안정성·자원 비용·성능 균형은 미확인 상태로 남아 있다. 또한 OpenCoF-17K의 도메인 분포와 외부 벤치마크 사이에는 여전히 분포 차이가 존재하므로 완전한 일반화 보장은 추가 연구가 필요하다.
실무 활용
OpenCoF-17K와 Wan-CoF는 비디오 생성기를 활용한 시공간적 추론 능력을 향상시키는 실험적 기반을 제공한다. 산업 응용에서는 물리 시뮬레이션 예측, 조작 계획의 시각적 시뮬레이션, 교육용 단계적 시각화 생성 등에 활용 가능성이 있다. 모델과 데이터의 공개는 재현성과 추가 연구를 촉진할 수 있다.
- 로봇 조작 정책의 시각적 시뮬레이션을 통해 초기 계획 검증과 디버깅을 위한 동영상 생성
- 교육용 퍼즐·수학·기하 교육 자료에서 단계적 풀이 과정을 자동 생성하여 학습 보조에 활용
- 물리 기반 장면 예측이 필요한 시뮬레이션 기반 테스트케이스 생성으로 자동화된 검증 파이프라인 보강
코드 공개 여부: 공개
키워드
용어 해설
- Chain-of-Frame
- — 프레임 연쇄 추론은 시계열으로 연결된 영상 프레임 자체에서 단계적 추론 과정을 전개하는 방식으로, 텍스트 기반 Chain-of-Thought와 달리 시각적 상태 변화를 연속적으로 모델이 생성하고 이용하게 한다. 이 접근은 초기 상태와 중간 상태 간 인과·물리적 전개를 모델 내 잠재공간으로 구성해 다단계 추론을 수행하게 하는 것이 핵심이다. 비디오 생성기에서 CoF가 작동하면 긴 시공간 제약 속에서도 물리·논리적 연속성을 유지하는 데 유리하다.
- Visual Reasoning Tokens (vt)
- — 시각적 추론 토큰은 DiT 계열 비디오 생성기의 시각 토큰 시퀀스에 학습 가능한 보조 토큰을 앞에 붙여 self-attention을 통해 전체 영상 잠재에서 추론 상태를 수집·분배하도록 설계된 메커니즘이다. 이 토큰은 시각 토큰과 양방향 상호작용을 하므로 프레임 간 전역적 계획과 국소적 시각 신호를 결합하여 경로·운동·구조 정보를 내재화한다. 실무에서는 vt가 경계 상태 고정과 최종 결과 결정을 돕는 것으로 관찰되었다.
- Textual Reasoning Tokens (tt)
- — 문자적 추론 토큰은 텍스트 조건 시퀀스 앞에 학습 가능한 토큰을 추가하여 cross-attention을 통해 시각 생성 과정에 일관된 고수준 프롬프트 우선순위를 제공하는 기법이다. 이 토큰은 prompt-독립적인 키/값 컨텍스트로 동작하여 각 공간 패치와 모든 시간에 동일한 텍스트 기반 규약을 투입한다. 실험에서는 tt가 지시 정렬성 및 구조적 규칙 준수에 특히 유리한 것으로 관찰되었다.
- DiT
- — DiT는 이미지·비디오 잠재 토큰을 self-attention 블록으로 처리하는 Transformer 기반 디퓨전 백본으로, 토큰 시퀀스 전반에 걸친 공간·시간 정보를 통합하는 구조적 특성을 가진다. 본 논문에서는 DiT 블록의 입력에 reasoning 토큰을 삽입하거나 텍스트 측에 토큰을 추가하는 방식으로 내부 상태를 확장하였다. DiT의 블록 깊이에 따른 역할 분화가 reasoning 토큰의 효과 위치를 결정하는 근거가 된다.
- LoRA
- — LoRA는 전체 가중치를 직접 업데이트하지 않고 저순위 분해 행렬을 추가로 학습하는 파인튜닝 기법으로, 파라미터·메모리 부담을 크게 줄이면서도 큰 모델을 효율적으로 미세조정할 수 있다. 본 연구에서는 Wan2.2-I2V-A14B에 LoRA로 미세조정을 적용하여 Wan-CoF를 얻었고, 데이터 중심의 효과를 깔끔하게 측정하는 데 활용됐다. LoRA 적용은 제한된 연산 자원에서 데이터 효과를 연구할 때 표준적 선택이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

