TL;DR
비디오 생성 모델이 시각적으로 그럴듯한 동작을 생성하는 수준에서 벗어나 물리 법칙을 바탕으로 근거 있는 추론을 수행하는지 판단하는 것은 세계 모델의 신뢰성과 안전성에 직접적인 영향을 미친다. 이 논문은 출력의 시각적 타당성만 평가하던 기존 관행을 넘어서 모델의 내부적 추론 과정이 법에 부합하는지를 단계별로 가시화하고 측정 가능한 지표로 환산했다. 따라서 물리 일관성, 법 선택 능력, 시간 일관성 같은 구체적 약점을 진단해 향후 모델 설계와 데이터·훈련 전략을 정교화할 근거를 제공한다.
왜 중요한가
비디오 생성 모델이 시각적으로 그럴듯한 동작을 생성하는 수준에서 벗어나 물리 법칙을 바탕으로 근거 있는 추론을 수행하는지 판단하는 것은 세계 모델의 신뢰성과 안전성에 직접적인 영향을 미친다. 이 논문은 출력의 시각적 타당성만 평가하던 기존 관행을 넘어서 모델의 내부적 추론 과정이 법에 부합하는지를 단계별로 가시화하고 측정 가능한 지표로 환산했다. 따라서 물리 일관성, 법 선택 능력, 시간 일관성 같은 구체적 약점을 진단해 향후 모델 설계와 데이터·훈련 전략을 정교화할 근거를 제공한다.
핵심 기여
Orchard 데이터셋으로 400개 사례의 법 기반 영상 코퍼스 구축
Orchard는 시뮬레이션 243개, 실험실 촬영 121개, 인터넷 36개를 합쳐 총 400개 사례를 포함하며 구체적 역학 법칙을 중심으로 단일법과 다중법 과제를 분리해 구성했다. 객체 분류를 네 가지 원시 도형으로 표준화해 물체 고유의 의미 있는 편향을 줄이고 물리 상태 주석을 일관되게 제공한다. 시뮬레이션 케이스는 정확한 물리 파라미터와 궤적을 포함해 객관적 법 기반 메트릭을 산출할 수 있게 설계되었다.
Perception Formulation Deduction의 3단계 과학적 추론 프로토콜 도입
입력은 인포그래픽 주석이 포함된 첫 프레임으로 통일하고 chain-of-frames 프롬프트로 모델이 프레임 단위 추론 흔적을 생성하도록 유도했다. Perception은 주석 읽기와 객체 분할을, Formulation은 방정식 선택과 상태 예측을, Deduction은 전체 궤적 생성을 각각 독립적 서브트랙으로 평가해 오류 원인을 단계별로 분리할 수 있게 했다. 이 프로토콜은 모델이 단순히 그럴듯한 출력물을 만드는지 여부를 넘어 어떤 단계에서 실패하는지를 진단할 수 있도록 설계되었다.
MLLM 기반 주관 점수와 물리 법칙 기반 객관 메트릭을 결합한 하이브리드 평가 체계
시각적 형식 준수와 가독성 같은 정성적 속성은 MLLM 심사자가 트랙별 루브릭으로 평가하고 물리 일관성은 시뮬레이션 기반의 정량적 지표로 측정해 두 축을 결합했다. Perception-Graphic과 Formulation-Graphic은 segmentation IoU로 채점하고 Deduction은 픽셀 수준 유사도, 시공간 마스크 오버랩, 3D 속도 오차 등 법 기반 지표로 평가했다. 이 평가 체계는 모델의 성공이 법적 내적 근거에 기반하는지 여부를 수치화할 수 있게 했다.
11개 모델의 대규모 벤치마크로 단계별 병목과 Sim to Real 한계를 규명
비디오 모델과 통합 모델을 포함해 11개 모델을 400개 사례, 5개 서브트랙, 3회의 롤아웃으로 평가해 모델군별 성능 분포를 제시했다. 결과는 Perception에서 Formulation으로, Formulation에서 Deduction으로 점수가 점진적으로 하락하는 병목 패턴을 보였고 다중법 과제와 실세계 데이터에서 성능 저하가 명확했다. 최고 비디오 모델 평균 점수는 0.473으로 Deduction에서의 지속적인 약점을 드러냈고 통합 모델이 Perception·Formulation에서 강한 반면 시간적 동역학에는 여전히 한계가 있었다.
핵심 아이디어 이해하기
문제를 시작점에서 규정하면 입력으로 주석이 포함된 첫 프레임과 chain-of-frames 프롬프트를 모델에 제공하면 모델은 각 프레임을 하나의 추론 단계로 취급해 시각적 신호를 물리량으로 바인딩하고 시간적 진화를 생성할 수 있다는 가정이 이 논문의 출발점이다. 기존 영상 벤치마크는 최종 출력의 시각적 타당성만을 평가했으나 이 접근은 출력이 도달한 경로를 보장하지 못했다. 따라서 가시적 추론 흔적을 요구하면 모델이 '무엇을 알고 있는지'와 '어떻게 그 지식을 운용하는지'를 분리해 관찰할 수 있다. 기본 원리는 세 단계의 인과적 분리이다. 첫째, Perception 단계에서는 주석과 객체를 정확히 바인딩해야 하며 이는 OCR과 인스턴스 분할 수준의 능력이다. 둘째, Formulation 단계에서는 바인딩된 물리량을 기호화하거나 목표 시점의 상태로 변환해 지배 법을 선택하거나 상태를 계산해야 하는데 이 단계는 물리 방정식과 단위 일관성 같은 수리적 사고를 요구한다. 셋째, Deduction 단계에서는 선택된 법을 시공간적으로 일관되게 적용해 전체 궤적을 생성해야 하며 이 단계는 물체 정체성 유지, 충돌 이벤트, 속도·가속도의 연속성을 모두 다뤄야 한다. 이 체계는 기존 접근과 달리 성능 저하의 원인을 구체적으로 분리한다. 단일법 과제는 법 선택과 시간전개를 병렬로 검정할 수 있게 하고 다중법 과제는 상태 전달과 법 체인의 조합적 어려움을 측정한다. 실험 결과는 Perception 성공이 Formulation과 Deduction의 보증이 아니며 특히 시간적 일관성 확보가 현재 비디오 모델의 핵심 병목임을 드러냈다.
방법론
입력은 인포그래픽으로 주석된 첫 프레임이며 출력은 chain-of-frames로 요청되는 비디오 또는 최종 프레임 아티팩트이다. 인포그래픽은 각 물리량을 대응 시각 객체 옆에 배치해 참조 해상도를 제거하고 모델이 주석의 공간적 연결을 직접 활용하도록 하여 주석 해독 부담을 최소화했다. 출력 유형은 전체 시퀀스, fade-to-white 최종 아티팩트, 또는 원장면에 오버레이된 상태 예측의 세 가지로 통일해 트랙별 평가를 표준화했다. Perception은 텍스트 서브트랙과 그래픽 서브트랙으로 나뉘며 Perception-Text는 주석 수치를 최종 프레임으로 정확히 복사하는 능력을, Perception-Graphic은 대상 객체를 원래 장면 위에 보존하면서 주변을 페이드아웃해 분리할 수 있는 능력을 측정한다. Formulation은 Formulation-Text에서 네 보기 선택형으로 법을 고르는 능력을 테스트하고 Formulation-Graphic에서 목표 시점 t⋆의 물체 위치와 속도를 원장면에 오버레이하는 상태 예측 능력을 측정한다. Deduction은 주석이 주어진 첫 프레임에서 전체 궤적을 생성해 시뮬레이션 기반의 정량적 지표와 비교한다. 평가는 MLLM 기반 주관 점수와 물리 법칙 기반 객관 지표를 결합해 수행한다. MLLM 심사는 트랙별 루브릭으로 형식 준수, 가독성, 응답 유효성을 채점하고 물리 기반 지표는 segmentation IoU, 픽셀 수준 유사도, 시공간 마스크 오버랩, 3D 속도 오차 등으로 계산한다. 모든 모델은 400개 사례와 5개 서브트랙에 대해 3회 반복 롤아웃으로 평가되어 통계적 변동을 완화했다.
관련 Figure

이 그림은 데이터 구성과 프로토콜 흐름을 한눈에 보여주어 논문이 법 기반 평가를 어떻게 체계화했는지를 시각적으로 요약한다. 왼쪽 패널은 Orchard의 데이터 출처와 과제 분포를, 중앙은 chain-of-frames 프롬프트로 유도되는 세 단계 평가 파이프라인을, 오른쪽은 MLLM 기반 주관 점수와 물리 법 기반 객관 지표의 결합을 나타내며 방법론 항목과 직접적으로 대응된다.
Apple-π의 개요 다이어그램으로 Orchard 데이터셋, 세 단계 프로토콜 Perception Formulation Deduction, 그리고 하이브리드 평가체계를 개략적으로 보여준다.
주요 결과
주요 결과는 전체적으로 비디오 모델이 Perception에서는 상대적으로 양호하나 Formulation과 Deduction에서 유의한 성능 저하를 보였다는 점이다. 최고 비디오 모델인 Seedance 2.0의 평균 점수는 0.473이었고 GPT Image 2와 Nano Banana 2는 각각 0.704와 0.699로 통합 모델이 Perception과 Formulation을 포함한 이해 관련 트랙에서 우세했다. Deduction 점수는 모든 모델에서 가장 낮아 시간적 법 일관성 확보가 여전히 핵심 한계로 남아있다. 서브트랙별로 Perception-Text가 Perception-Graphic보다 일반적으로 쉬웠으며 Formulation-Text와 Formulation-Graphic 사이에는 방정식 선택과 상태 예측의 격차가 존재했다. 다중법 과제는 단일법보다 어렵고 이는 법 간 상태 전달과 충돌 이벤트 유지에서의 실패를 반영한다. 데이터 출처 관점에서는 시뮬레이터 데이터에서의 성능이 실세계 데이터보다 높아 Sim to Real gap이 뚜렷하게 관찰되었다. 모델 군별 분석은 두 가지 시사점을 제공한다. 대규모 비디오 사전학습은 물리적 프라이어를 일부 획득하게 하지만 그것만으로는 법 기반 추론을 보장하지 못하며 특정 reasoning 데이터로의 추가 지도학습은 Perception 계열 능력을 개선하되 Formulation과 Deduction으로의 전이는 불완전했다. 통합 이해-생성 모델이 Perception과 Formulation에서 강점을 보였으나 Deduction에서의 한계는 공통으로 관찰되어 향후 모델 설계는 시간적 동역학 생성 능력과 명시적 이해 모듈을 결합할 필요가 있다.
기술 상세
전체 아키텍처와 프로토콜은 입력으로 주석이 포함된 첫 프레임과 chain-of-frames 프롬프트를 받고 출력으로 모델이 생성한 비디오 시퀀스 또는 최종 프레임 아티팩트를 사용하도록 표준화되어 있다. Orchard의 시뮬레이션 케이스는 NVIDIA Isaac Sim으로 생성되어 정확한 물리 파라미터와 픽셀 단위 궤적을 제공하므로 Deduction 트랙의 물리 기반 객관 메트릭을 직접 계산할 수 있게 설계되었다. 데이터는 네 가지 원시 도형을 객체 어휘로 표준화해 객체별 의미론적 편향을 줄이고 물리 상태의 일관적 주석을 보장했다. Formulation-Text 트랙은 네 보기 선택형으로 법을 고르게 하고 정답 선택 시 각 기호에 주석의 수치를 치환한 형태를 최종 아티팩트로 요구해 단위·기호 바인딩 오류를 검출한다. Formulation-Graphic은 목표 시점 t⋆에서의 각 객체 위치와 속도 화살표를 원장면에 오버레이해 상태 예측 정확도를 segmentation IoU로 평가한다. Deduction은 생성된 시퀀스의 각 프레임을 시뮬레이션 기반의 궤적과 비교해 픽셀 수준 fidelity, 시공간 마스크 오버랩, 그리고 3D 속도 오차로 법 일관성을 정량화한다. 평가 파이프라인은 MLLM 심사자와 물리 기반 계산 모듈으로 구성되어 MLLM 심사는 형식 준수와 가독성 같은 정성적 속성에 가중치를 부여하고 객관 지표는 법 기반 정확성에 초점을 맞춘다. 실험은 11개 모델을 대상으로 400개 케이스와 5개 서브트랙, 각 케이스에 대해 3회 롤아웃을 수행해 통계적 안정성을 확보했다. 구현 세부사항과 루브릭, 메트릭 정의는 부록 D와 E에 수치와 함께 정리되어 있다.
한계점
논문이 명시한 한계 중 하나는 Sim to Real gap으로서 시뮬레이션에서 확보한 법 기반 정보가 실세계 영상의 시각적 잡음과 재질 효과 앞에서 성능 저하를 보였다는 점이다. 두 번째 한계는 Deduction 단계에서의 지속적인 취약성으로서 모델이 법을 선택하더라도 시간 축을 따라 일관되게 적용하는 데 실패하는 경우가 빈번했다. 세 번째 한계는 다중법 과제에서의 상태 전달 약점으로서 단일법에서 학습한 모듈이 법 전환 지점에서 물리 상태를 정확히 이관하지 못했다.
실무 활용
Apple-π의 구성과 오픈 소스 코드 덕분에 연구자와 엔지니어는 비디오 모델의 물리적 추론 약점을 정확히 진단하는 도구로 활용할 수 있다. Orchard 데이터와 평가 프로토콜은 모델 개발 초기 단계에서 법 기반 결함을 검출하고 개선 효과를 측정하는 내부 벤치마크로 활용 가능하다.
- 비디오 모델의 학습 파이프라인에서 Perception Formulation Deduction별 성능 회귀를 검출하는 내부 검증 스위트로 사용 가능하다.
- 물리 기반 제약이나 명시적 법 모듈의 도입이 Deduction 성능에 미치는 영향을 ablation 실험으로 평가하는 데 활용할 수 있다.
- 시뮬레이션에서 학습한 모델의 실세계 일반화 실패 지점을 규명해 데이터 보강 전략과 도메인 적응 효과를 측정하는 데 사용할 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Chain-of-Frames
- — 연속 프레임을 단계적 사고의 단위로 사용하여 모델이 프레임별로 추론 과정을 형성하도록 유도하는 프롬프트 방식으로, 입력 첫 프레임의 주석을 시간축으로 확장해 모델의 가시적 추론 흔적을 얻는 데 중요하다.
- Law-Grounded Evaluation
- — 고전 역학의 수식과 예측 궤적을 기준으로 모델 출력의 물리적 일관성을 수치화하는 평가 방식으로, 단순한 시각적 타당성 대신 물리 법칙에 따른 정량적 비교를 가능하게 한다.
- Orchard Dataset
- — 400개 사례로 구성된 물리 영상 집합으로서 시뮬레이션, 실험실 촬영, 인터넷 영상이 혼합되어 있으며 단일법 과제와 다중법 과제를 분리해 법 기반 진단과 조합 일반화를 평가하도록 구성되었다.
- Perception Formulation Deduction
- — 모델이 물리 문제를 해결하는 과정에서 먼저 시각적량을 바인딩하고 다음으로 지배 법을 기호나 상태로 표상하며 마지막으로 그 법으로 시간발전을 생성해내는 세 단계 평가 프로토콜로서 오류 원인을 단계별로 분리한다.
- Sim-to-Real Gap
- — 시뮬레이터로부터 얻은 정확한 물리 파라미터와 픽셀 정밀 궤적을 모델이 학습했더라도 실제 촬영 영상의 시각적 잡음과 재질 효과 때문에 성능이 저하되는 현상으로, 법 기반 일반화 한계를 드러낸다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.