용어 해설
- 프레임 연쇄 추론(Chain-of-Frame)
- — 프레임 연쇄 추론은 시계열으로 연결된 영상 프레임 자체에서 단계적 추론 과정을 전개하는 방식으로, 텍스트 기반 Chain-of-Thought와 달리 시각적 상태 변화를 연속적으로 모델이 생성하고 이용하게 한다. 이 접근은 초기 상태와 중간 상태 간 인과·물리적 전개를 모델 내 잠재공간으로 구성해 다단계 추론을 수행하게 하는 것이 핵심이다. 비디오 생성기에서 CoF가 작동하면 긴 시공간 제약 속에서도 물리·논리적 연속성을 유지하는 데 유리하다.
- 시각적 추론 토큰(Visual Reasoning Tokens (vt))
- — 시각적 추론 토큰은 DiT 계열 비디오 생성기의 시각 토큰 시퀀스에 학습 가능한 보조 토큰을 앞에 붙여 self-attention을 통해 전체 영상 잠재에서 추론 상태를 수집·분배하도록 설계된 메커니즘이다. 이 토큰은 시각 토큰과 양방향 상호작용을 하므로 프레임 간 전역적 계획과 국소적 시각 신호를 결합하여 경로·운동·구조 정보를 내재화한다. 실무에서는 vt가 경계 상태 고정과 최종 결과 결정을 돕는 것으로 관찰되었다.
- 문자적 추론 토큰(Textual Reasoning Tokens (tt))
- — 문자적 추론 토큰은 텍스트 조건 시퀀스 앞에 학습 가능한 토큰을 추가하여 cross-attention을 통해 시각 생성 과정에 일관된 고수준 프롬프트 우선순위를 제공하는 기법이다. 이 토큰은 prompt-독립적인 키/값 컨텍스트로 동작하여 각 공간 패치와 모든 시간에 동일한 텍스트 기반 규약을 투입한다. 실험에서는 tt가 지시 정렬성 및 구조적 규칙 준수에 특히 유리한 것으로 관찰되었다.
- DiT(디퓨전 기반 영상 변환기)(DiT)
- — DiT는 이미지·비디오 잠재 토큰을 self-attention 블록으로 처리하는 Transformer 기반 디퓨전 백본으로, 토큰 시퀀스 전반에 걸친 공간·시간 정보를 통합하는 구조적 특성을 가진다. 본 논문에서는 DiT 블록의 입력에 reasoning 토큰을 삽입하거나 텍스트 측에 토큰을 추가하는 방식으로 내부 상태를 확장하였다. DiT의 블록 깊이에 따른 역할 분화가 reasoning 토큰의 효과 위치를 결정하는 근거가 된다.
- LoRA(저순위 가중치 분해 파인튜닝)(LoRA)
- — LoRA는 전체 가중치를 직접 업데이트하지 않고 저순위 분해 행렬을 추가로 학습하는 파인튜닝 기법으로, 파라미터·메모리 부담을 크게 줄이면서도 큰 모델을 효율적으로 미세조정할 수 있다. 본 연구에서는 Wan2.2-I2V-A14B에 LoRA로 미세조정을 적용하여 Wan-CoF를 얻었고, 데이터 중심의 효과를 깔끔하게 측정하는 데 활용됐다. LoRA 적용은 제한된 연산 자원에서 데이터 효과를 연구할 때 표준적 선택이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.







