TL;DR
비디오 생성 모델의 물리 현상 이해를 측정하는 벤치마크의 신뢰도 문제를 해결하기 위해, 프롬프트 품질, 아티팩트 제거, 샘플 단위 점수 도입을 제안한다. 이를 통해 물리적 규칙에 대한 모델의 실제 추론 능력을 더 정확하게 반영하고, 벤치마크 결과의 해석 가능성과 재현성을 높인다.
왜 중요한가
비디오 생성 모델의 물리 현상 이해를 측정하는 벤치마크의 신뢰도 문제를 해결하기 위해, 프롬프트 품질, 아티팩트 제거, 샘플 단위 점수 도입을 제안한다. 이를 통해 물리적 규칙에 대한 모델의 실제 추론 능력을 더 정확하게 반영하고, 벤치마크 결과의 해석 가능성과 재현성을 높인다.
핵심 기여
Prompt Quality 개선
6개 필드로 구성된 템플릿 기반 프롬프트와 모델별 최적화된 인터페이스를 도입하여 원래 프롬프트의 모호성과 불일치를 제거하고 평가 대상 모델의 물리 추론 능력을 더 정확하게 측정하도록 했다.
Metric Aggregation 개선
샘플 단위로 Physics-IQ Verified 점수를 산출하고, 모든 샘플과 지표에 동일한 가중치를 부여하는 집계 방식으로 바꿔 실패 모드를 샘플별로 추적 가능하게 했다.
Artifact Removal 및 데이터셋 수정
Ground-truth 영상에서 spurious activations를 제거하고 end_effect_frames / freeze_areas를 사용해 아티팩트를 차단하는 방식으로 원본 벤치마크의 측정 오차를 줄였다.
핵심 아이디어 이해하기
출발점: Physics-IQ는 실제 물리 실험 ground-truth와 VGMs의 예측 영상 간의 차이를 IoU/MSE로 비교한다. 한계: 프롬프트의 불명확성, 관찰 가능한 아티팩트, 데이터 집계 방식으로 인해 물리 이해도와 시각적 현실감이 비선형적으로 얽혀 측정 신호가 왜곡될 수 있다. 해결 원리: 프롬프트를 명확하게 구조화하고, 아티팩트를 제거하며, 샘플 단위로 점수를 산정해 각 샘플의 실패 원인을 traceable하게 만들고, 모든 샘플에 균등한 영향력을 부여한다. 달라진 점: 개선된 프롬프트가 대부분의 모델에서 점수를 상승시키고, 아티팩트 제거는 점수를 감소시키나 측정의 순도를 높인다. 이로써 물리 이해의 신뢰성 있는 신호를 얻고 랭킹 변화의 해석 가능성을 높인다.
방법론
전체 접근: 세 가지 축으로 Physics-IQ 벤치마크를 정교화한다. 첫째, 프롬프트 품질 개선(Fix 1): Original Prompt를 6개 필드로 재구성하고, CAM/STYLE/SCOPE를 도입해 모델의 입력 인터페이스에 맞춘 템플릿을 사용한다. 둘째, 산출물 집계 개선(Fix 2): 샘플 n에 대해 per-sample Physics-IQ Verified 점수를 정의하고, 4개 지표(SP, ST, WS, MSE)의 합산을 샘플 단위로 수행한다. 셋째, 아티팩트 제거(Fix 3): ground-truth 영상에서 end_effect_frames와 freeze_areas를 수동 주석으로 표시하고, 해당 구간의 활성화를 제거하여 불필요한 신호를 차단한다. 공식 수식: s_n^{Physics-IQVerified} = 1/4 [ clip_0_1( r_MSE^n / vMSE^n ) + sum_{M∈{SP,ST,WS}} clip_0_1( vMIoU^n / rMIoU^n ) ]; 전체 점수은 N개의 샘플의 산술평균으로 결정된다. 여기서 v는 관찰 지표, r은 두 번째 Take의 기준점으로 각 샘플별 물리적 변이 한도를 반영한다. 이 구조는 샘플별 실패 원인을 바로 추적할 수 있게 한다.
관련 Figure

해당 도해는 프롬프트 품질, 지표 집계, 아티팩트 제거의 세 축 개선이 어떻게 결합되어 벤치마크를 정제하는지 한눈에 보여준다. 논문의 방법론적 핵심을 보강하는 직관적 근거를 제공한다.
Original Physics-IQ와 Physics-IQ Verified의 핵심 개선점 다이어그램.

원래 프롬프트의 모호성 및 아티팩트가 점수에 미치는 영향을 시각적으로 보여주며, 수정된 프롬프트 및 artifact 수정의 필요성을 뒷받침한다.
Unclear Prompts 및 Artifact Corrections 예시

SETUP/SCENE/ACTION/CAM/STYLE/SCOPE 등 6 필드 구성과 templater의 작동 원리를 시각적으로 제시해 프롬프트 재구성의 구체적 방법을 보여준다.
Full prompt 개선 및 templater 예시
주요 결과
주요 벤치마크 결과: Original Score 대비 Verified Score로의 이동에서 대부분의 VGMs의 점수가 증가했다(예: Cosmos3-N, Grok Video, HunyuanV-1.5). Ranking 변화가 관측되며, Wan 2.2는 Verified에서 하락하고 Sora 2 및 Cosmos3-N은 상승했다. 상관관계 분석에서 Spearman ρ = 0.65, Kendall τ = 0.46으로, 원래 평가와 비교해 의미 있는 랭킹 차이가 나타났다. 부가 분석에서 Prompt의 Best-Practice(Prompt 개선)가 점수의 하위 구성요소를 유의하게 향상시켰고, Artifact Cleaning은 총 점수를 감소시키나 측정의 순도를 높였다. Bootstrap 재표본화 결과도 랭킹 차이가 의미 있음을 시사했다. 예시 수치: Cosmos3-N original bpp 27.8 ± 2.2 / SP 40.8 ± 1.8 / ST 19.7 ± 3.2 / WS 25.1 ± 1.5 / MSE 0.8 ± 0.1; Wan 2.2 original bpp 36.6 ± 0.6 / SP 53.2 ± 0.7 / ST 28.2 ± 0.7 / WS 35.3 ± 0.6 / MSE 0.6 ± 0.0.
관련 Figure

데이터셋 수정 비율 및 프롬프트 이슈 분포를 요약하는 시각으로, 제1/제2 수정의 영향과 벤치마크 해석에의 함의를 보여준다.
데이터셋 수정 현황 및 문제 분포

모델별로 Original과 Verified의 점수 차이를 한 눈에 비교하는 차트로, 프롬프트 개선의 효과와 아티팩트 제거의 영향력을 함께 시각화한다.
Physics-IQ 점수 비교: Original vs Verified

프롬프트 개선, 아티팩트 제거의 영향 및 샘플-레벨 점수의 해석에 관한 다면적 분석을 시각화한다.
Prompts와 Artefacts의 영향에 대한 종합 분석 도표

GT-프롬프트 대비 OP/BPP에서의 프롬프트 차이가 실제 영상 생성에 어떻게 반영되는지 프레임 단위 예시를 제공한다.
WAN-i2v GT vs OP vs BPP: 프롬프트 개선의 시각적 예시
기술 상세
아키텍처/데이터: 66개 물리 실험으로 구성된 Physics-IQ 데이터셋에서 I2V 벤치마크를 재현. Ground-truth는 GT1/GT2로 두 차례 촬영된 실제 영상. 모델은 Wan 2.2, Grok Imagine Video, HunyuanV-1.5, Cosmos3-Nano, P-Video, Sora 2의 6개 이미지-투-비디오 VGMs를 사용. Prompting: 6-field 템플릿 SETUP, SCENE, ACTION, CAM, STYLE, SCOPE으로 재구성. 아티팩트 제거: end_effect_frames, freeze_areas 주석으로 마크하여 프롬프트/실험 설정에서 발생하는 악의적 신호 제거. 수학적 정의: per-sample s_n^{Physics-IQVerified} = 1/4( clip_0_1(r^n_MSE / v^n_MSE) + ∑_{M∈{SP,ST,WS}} clip_0_1( v^n_M / r^n_M ) ); 최종 s^{Physics-IQVerified} = (1/N) ∑_n s^n. 평가 변수로 SP, ST, WS, MSE를 사용하고, MSE의 경우 보정으로 음의 방향으로 해석. 실험 설계: 8가지 설정(Original/bpp prompts × Original/verified GT × Original/verified score)로 분해된 factorial 디자인. 통계: 표본별 표준편차, 대칭적 신뢰구간 및 부트스트랩으로 순위 상관도(Spearman ρ, Kendall τ) 보고.
실무 활용
Physics-IQ Verified는 VGMs의 물리 현상 이해를 평가하는 신뢰 가능한 벤치마크 프레임워크를 제공한다. 프롬프트 템플릿, 아티팩트 제거, 샘플 단위 점수로 평가의 해석 가능성과 재현성을 높인다.
- 새로운 이미지-비디오 VGMs의 물리 이해 평가를 위한 벤치마크로 사용
- 프롬프트 템플릿의 영향 분석 및 모델별 prompting 전략 수립
- 샘플 단위 레벨에서의 오류 원인 분석 및 모델 개선 방향 제시
- Ground-truth 아티팩트 제거를 통한 측정 순도 향상 및 벤치마크 신뢰도 강화
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Prompting
- — 프롬프트의 구성과 형식을 설계하여 모델 입력 조건을 명확히 하고 해석 가능한 출력을 유도하는 방법. 본 연구에서 프롬프트 품질은 VGMs의 물리적 추론 능력 측정의 정확성과 신뢰성에 직접 영향을 준다.
- Artifact Removal
- — 실험 영상에서 물리 현상과 무관한 시각적 변화(촬영 오차, 장비 움직임 등)를 제거하거나 억제하여 측정 지표가 물리 현상에만 민감하도록 하는 처리 절차.
- Sample-Level Scoring
- — 개별 샘플마다 점수를 계산하고 이를 평군화하는 방식으로, 샘플별 실패 원인 추적 가능성과 공정한 가중치를 확보하는 평가 전략.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.