왜 중요한가
텍스트 프롬프트는 장면의 물리적 전개를 압축해서 제시하기 때문에 직접 텍스트만으로는 프롬프트별 고유한 동적 과정을 복원하기 어렵습니다. VideoCoCo는 그 과정을 실행 가능한 Blender 코드로 외부화해 결정적 드래프트를 만들고, 드래프트를 조건으로 편집기가 외형을 입혀 최종 영상을 생성하도록 분업시킵니다. 이 분해는 물리적 일관성을 크게 높여 PhyGenBench에서 OmniWeaving 기준 0.475에서 0.558로, VBench-2.0에서 52.18%에서 77.88%로 향상시켜 실용적 제어성과 검증 가능성을 동시에 확보합니다.
핵심 기여
코드 기반 에이전트 이중 엔진 프레임워크
VideoCoCo는 텍스트 프롬프트로부터 Blender Python 코드를 합성하는 코드 에이전트와, 해당 코드를 샌드박스에서 실행해 시공간 드래프트를 렌더링하는 실행 엔진, 그리고 드래프트와 편집 지침을 입력으로 받아 실사 동영상을 생성하는 편집 엔진으로 구성된 이중 엔진 체계를 제시합니다. 이 구성은 과정 수준의 추론(what happens)을 코드로 고정하고, 외형 결정(what it looks like)은 편집기가 담당하게 하여 두 역할을 분리합니다. 그 결과 물리적 동작을 보장하면서도 시각적 품질을 유지하는 설계적 이점을 확보합니다.
VideoCoCo-3K 삼중쌍 데이터셋
드래프트·편집지침·교사 편집 출력의 트리플렛 3,000개로 이루어진 VideoCoCo-3K를 구축해 드래프트 기반 편집기 적응을 위한 감독 신호를 제공합니다. 각 트리플렛은 코드 에이전트가 생성한 Blender 프로그램과 샌드박스 렌더링(드래프트), A_edit가 만든 편집 지침, 그리고 강력한 교사 편집기(Seedance 2.0)를 통해 얻은 고품질 타깃으로 정렬되어 있습니다. 데이터셋은 평가용 프롬프트와 중복을 제거해 편집기 적응시 과적합을 줄이고 재현 가능한 학습 자료 역할을 합니다.
드래프트·편집기 분리로 검증된 물리적 일관성 개선
OmniWeaving 기반 편집기에 VideoCoCo 파이프라인을 결합하면 PhyGenBench 평균 점수가 0.475에서 0.558로 상승하고 VBench-2.0 평균이 52.18%에서 77.88%로 증가하는 등 물리적 일관성이 크게 향상됩니다. 추가 실험에서 드래프트 자체만으로(튜닝-프리) 평균을 0.506 수준으로 끌어올렸고, LoRA 적응을 적용하면 0.558로 최고 성능을 기록해 드래프트와 편집기 적응의 상호 보완성을 증명했습니다. 특히 열역학·재료 변화 같은 외형 의존적 물리 범주에서 개선 폭이 큽니다.
핵심 아이디어 이해하기
자연어 프롬프트는 사건의 의도만 압축해 전달하므로 물리적 전개의 세부를 암시적으로 추정하게 하면 일관성 문제가 발생합니다. VideoCoCo는 코드 에이전트가 Blender Python으로 장면 구성과 물리 파라미터, 시간적 변화를 명시하는 프로그램을 합성하고 이를 샌드박스에서 실행해 결정적 드래프트를 얻는 방식으로 이 문제에 대응합니다. 이후 편집 에이전트는 원래 프롬프트와 드래프트를 읽어 외형 중심의 편집 지침을 만들고, 드래프트와 지침을 조건으로 편집 모델이 실사 영상을 생성하도록 하여 동작(드래프트)이 무엇이고 외형(지침)이 어떻게 보일지 역할을 분리합니다.
관련 Figure

이 도식은 핵심 아이디어인 '코드가 과정 수준의 체인오브쏘트가 된다'는 점을 시각적으로 요약합니다. 특히 코드 합성 단계가 드래프트 생성으로 연결되고, 드래프트가 편집기로 전달되는 흐름을 강조해 역할 분담과 검사 가능성(inspectability)을 직관적으로 확인할 수 있습니다.
Figure 1은 기존 CoT 방식들과 VideoCoCo의 구조 차이를 비교한 도식으로, 텍스트 플래닝·테스트타임 후보 검색·시각 상태 연속 방식과 달리 실행 가능한 코드 합성→샌드박스 실행→드래프트 조건 편집의 파이프라인을 한눈에 보여줍니다.
방법론
파이프라인은 세 단계 흐름으로 구성됩니다. 첫째, 코드 에이전트 A_code가 텍스트 프롬프트 p에서 self-contained한 Blender Python 프로그램 c를 합성하고, 둘째, 샌드박스 Blender 환경에서 c를 실행해 저해상도·무채색의 시공간 드래프트 d를 렌더링합니다. 셋째, 편집 지침 에이전트 A_edit가 p와 d를 입력으로 받아 외형 중심의 편집 지침 e를 작성하고, 적응된 편집기 G_θ가 조건부 확산 기반의 denoising 과제를 통해 (d,e)로부터 최종 실사 동영상 v를 생성합니다. 편집기 적응은 VideoCoCo-3K 삼중쌍을 사용해 수행하며, 전체 학습에서는 표준 조건부 노이즈 예측 손실을 최소화합니다.
관련 Figure

이미지는 데이터 생성(교사 기반 트리플렛)과 편집기 학습의 연결을 명확히 합니다. 드래프트의 저충실도 시각 스타일과 편집기가 이를 실사로 바꾸는 책임 분리가 그림에서 잘 드러나며, VideoCoCo-3K 생성 파이프라인을 이해하는 데 핵심적입니다.
Figure 2은 실행 엔진과 생성 엔진의 세부 워크플로우를 보여주며, 코드 합성·샌드박스 렌더링에서 얻은 스파티오템포럴 드래프트가 편집 지침과 결합되어 최종 고품질 영상으로 변환되는 흐름을 단계별로 나타냅니다.
주요 결과
정량 실험에서 VideoCoCo는 물리적 일관성을 크게 향상시켰습니다. PhyGenBench에서 OmniWeaving 기준 평균 일관성이 0.475에서 VideoCoCo 결합 시 0.558로 상승했고, VBench-2.0에서는 평균 plausibility가 52.18%에서 77.88%로 증가해 평균 성능이 최상위에 올랐습니다. 에디터 적응 방식별로는 tuning-free만으로도 드래프트의 기여로 평균이 약 0.506 수준으로 올라갔고, LoRA 기반 적응이 전체 평균 0.558로 가장 우수해 드래프트와 편집기 미세조정이 상호 보완적임을 보였습니다. 범주별 개선은 재료(Material)와 열역학(Thermotics)에서 특히 컸으며, 이는 외관 기반 학습만으로는 포착하기 어려운 동적 과정의 보강 효과를 시사합니다.
관련 Figure

정성적 비교에서 OmniWeaving이 시각적으로 그럴듯하나 의도된 물리 동작을 위반하는 경우가 있는 반면, VideoCoCo는 드래프트에 따라 동작 타이밍과 결과를 더 정확히 보존하는 모습을 보여 물리적 일관성이 개선되었음을 사례로 지원합니다.
Figure 3은 몇 가지 물리적 현상(승화, 진공 붕괴, 충격 파편화, 부력 등)에 대해 드래프트, 베이스라인(OmniWeaving), VideoCoCo 결과를 비교한 질적 사례를 배열로 보여줍니다.
기술 상세
편집기 적응은 조건부 확산 모델의 노이즈 예측 손실로 학습됩니다. 손실은 로 표현되며 여기서 는 타깃 영상의 확산 잠복 변수의 시점 t에서의 노이즈화된 표현이고 은 표준 정규 분포에서 샘플된 노이즈입니다. 입력 흐름은 타깃 영상 y의 잠복 z_0를 노이즈화해 z_t를 얻고, 편집기 네트워크는 (z_t,t,d,e)를 받아 원래의 노이즈 성분을 예측해 복원하도록 학습합니다. 데이터 측면에서는 VideoCoCo-3K가 3,000 트리플렛으로 구성되며 교사 편집기 G_T으로 Seedance 2.0을 사용해 고품질 타깃 y_i를 생성했습니다. 적응 전략으로는 tuning-free, full fine-tune, LoRA(low-rank adaptation)를 비교했고 LoRA가 파라미터 효율성과 성능 측면에서 우수했습니다.
한계점
실행 가능한 시뮬레이션을 도입하면 추가적인 추론 지연이 발생해 배치 처리나 실시간 생성 환경에 제약이 생깁니다. Blender 기반 시뮬레이터의 표현력 제약으로 난류와 같이 고난도 유체역학 현상은 제로샷으로 정확히 재현하기 어렵고, 교사 편집기의 한계가 데이터 품질에 직접적으로 영향을 미칩니다. 또한 VideoCoCo-3K의 규모(3,000 트리플렛)와 교사 편집기의 특성에 따라 편집기 적응이 특정 도메인에 편향될 가능성이 있어 광범위한 일반화를 위해 더 큰 또는 전문화된 시뮬레이터 결합이 필요합니다.
실무 활용
VideoCoCo는 물리적 일관성이 중요한 텍스트→동영상 생성 작업에서 실용적으로 사용될 수 있으며, 코드 에이전트를 통해 생성·검사 가능한 중간 산출물을 확보해 사용자가 과정과 결과를 점검하고 수동으로 수정할 수 있습니다. 드래프트는 재현 가능하고 디버깅 가능한 형태이므로 특정 물리 현상을 재현하거나 제어해야 하는 시나리오에 적합합니다. 다만 실행 시 블렌더 렌더링과 편집기 호출에 따른 추가 지연이 발생하므로 실시간 응답성이 필요한 애플리케이션에는 제약이 있습니다.
- 교육용 물리 시뮬레이션 데모를 자연어로 생성해 시각적 설명과 물리 거동을 일치시킬 때
- 제품 설계나 시연 영상에서 특정 물리적 상호작용을 정확히 재현해야 하는 프로토타입 제작
- 과학 커뮤니케이션·뮤지컬·광고 등에서 의도한 동작을 검증 가능한 드래프트로 고정한 뒤 고품질 영상으로 전환할 때
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 코드 기반 체인오브쏘트(Code-as-CoT)
- — 프롬프트로부터 자연어 대신 실행 가능한 코드(예: Blender Python)를 합성해 장면과 시간 흐름을 명시하고, 이 코드를 중간 표현으로 삼아 시뮬레이션으로 드래프트를 생성하는 방식입니다. 실행 가능성·검사성·결정성을 확보합니다.
- 실행 가능한 드래프트(Executable Draft)
- — 코드 에이전트가 쓴 Blender 스크립트를 샌드박스에서 렌더링해 얻는 저해상도·무채색의 시공간적 동영상으로, 모션과 상호작용을 프레임 단위로 결정하고 이후 편집기의 구조적 조건으로 사용합니다.
- 드래프트 조건 편집(Draft-Conditioned Editing)
- — 실행 드래프트와 편집 지침을 함께 입력으로 받아 드래프트의 시간적 구조를 유지하면서 외관을 사진 실사로 바꾸는 편집 모델 학습 전략을 가리킵니다. 드래프트는 동작, 지침은 외형을 담당합니다.
- VideoCoCo-3K 데이터셋(VideoCoCo-3K)
- — 드래프트·편집지침·교사 편집 결과의 삼중쌍으로 구성된 3,000개 트리플렛 데이터셋으로, 드래프트 기반 편집기 학습을 위해 샌드박스 렌더와 강력한 교사 편집기(Seedance 2.0)를 동원해 생성했습니다.
- LoRA 적응(LoRA Tuning)
- — 기존 대형 편집기 가중치를 대부분 고정한 채 저순위 저차원 보정 행렬만 학습해 드래프트→실사 변환 능력을 추가하는 경량 적응법으로, 본 논문에서는 전체 미세조정보다 과적합 위험이 적어 더 우수한 결과를 보였습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.