왜 중요한가
시네마틱 품질 평가는 프롬프트를 얼마나 잘 따르는지보다 않는 요소인 미학·연출·감정의 수준에 좌우된다. 기존 벤치마크는 주로 프롬프트 준수 여부를 측정해 ‘right’를 다루지만, 실전 영상 제작의 핵심인 ‘goodness’에 관한 신호를 놓친다. EvalVerse는 파이프라인 관점의 체계적 분류와 전문가 보정으로 신뢰 가능한 평가 신호를 제공하고, 멀티샷/오디오-비주얼 통합 등 복합 시나리오를 다룰 수 있는 생태계를 구축한다.
핵심 기여
Pipeline-aware cinematic taxonomy 제시
전문 영화 제작 워크플로우를 프리-프로덕션, 프로덕션, 포스트-프로덕션의 3단계로 구성하고, 7개의 시네마틱 아스펙트, 18개의 메인 디멘션, 45개의 서브 디멘션, 196개의 래셔널로 ‘goodness’의 체계적 정의를 제시한다.
Real-to-Gen 데이터 엔진 도입
밀리언 규모의 전문 영상 데이터에서 테스트 페어를 구성하고, 고충족도 Ground Truth/Reference/Videos 간의 다중 모달 매핑을 통해 실제 프로덕션 분포를 반영하는 페어를 자동 생성한다.
전문가 보정 CoT 평가 체계
34명의 전문가(영화 제작자 및 아티스트, 연구자)와 연계한 CoT 기반 평가를 도입하고, Perception Extractor를 통해 얻은 증거로 VLM의 CoT를 점검·보정한다.
2단계 VLM 파인튜닝 및 인간 정렬
Preference Alignment로 쌍 비교 데이터를 학습하고 Score Calibration으로 절대 점수를 학습한다. 이 과정을 통해 두 단계에서 인간 선호를 모델 출력에 정렬한다.
다층적 커버리지 및 RL 적용 가능성
음향-영상 동기화, 멀티샷 시퀀스, 시네마틱 디자인 등 전체 모달리티를 다루고, 향후 보상 모델과 RL 기반 에이전트 워크플로의 신뢰 가능한 신호를 제공한다.
핵심 아이디어 이해하기
기존 영상 생성 평가가 프롬프트 적합성만 확인하는 수준에 머물렀다면, EvalVerse는 전문 영화 제작의 워크플로우를 모듈화하여 ‘goodness’를 진단 가능한 다층적 구조로 재구성한다. 파이프라인의 각 단계에서 필요한 시각적 언어와 오디오-비주얼의 일관성, 연출의 감정적 흐름 등을 정량화하고, 인간 전문가의 판단을 반영한 CoT-기반 추론으로 해석 가능성을 높인다. 또한, VLM의 한계를 넘어선 SFT 기반 파라미터 주입으로 추상적 차원을 정교하게 보정해 신뢰도 있는 점수를 제공한다.
방법론
Step-I Taxonomy Establishment: 프리프로덕션/프로덕션/포스트프로덕션으로 나누고 7개의 Cineamtic Aspects, 18 Main Dimensions, 45 Sub-Dimensions, 196 Rationales를 정의한다. Step-II Dataset Curation: Real-to-Gen 데이터 엔진을 통해 테스트 페어를 생성하고, Ground Truth/Reference/Prompt/Images/Videos를 포함하는 다중 모달 입력을 구성한다. Step-III Expert Evaluation: 34명의 전문가 팀이 Ground Truth/Reference와 모델 출력을 비교·랭킹하며, Cross-Checking 및 Validation으로 ground-truth 데이터셋을 구축한다. Step-IV Machine Evaluation Suite: Vision-Language Model(Mθ*)을 Perception Operator(Eprof)로 증거를 추출하고, multi-question X를 이용해 CoT를 생성한 뒤 Sd = Mθ*(V, X) · Igate(p, C)로 차원을 점수화한다. Step-V Application: RLHF/GRPO 등 보상 모델 학습과 Agent 시스템에 적용될 신호를 제공한다.
관련 Figure

Figure 1은 5단계(Taxonomy Establishment, Dataset Curation, Expert Evaluation, Machine Evaluation Suite, Application) 간의 흐름과 상호작용을 보여주며, 파이프라인 중심의 평가 설계의 기초를 제공한다.
EvalVerse의 다섯 단계 파이프라인 개요를 시각화한 다이어그램

Figure 2는 Pre-Production/Production/Post-Production의 3단계와 196 래셔널의 구조를 시각적으로 제시해, 어떠한 진단이 어떤 단계에 속하는지 해석 가능하게 한다.
Pipeline-aware evaluation taxonomy를 설명하는 Fig.2

Figure 3은 데이터 주입, 샘플링, 테스트 페어 구성의 전체 프로세스를 보여주며 Ground Truth 비디오, Reference 비디오, Prompt 간의 연결 관계를 명시한다.
데이터 엔진과 테스트 페어 구성 파이프라인
주요 결과
Text-to-Video(T2V)에서 Seedance 2.0이 전체적으로 가장 우수한 성능을 보였고 Kling-v3-Omni, Happy Horse 1.0이 뒤를 이었다. C2V(R2V) 설정에서도 Seedance 2.0, Kling-v3-Omni, Happy Horse 1.0이 상위 그룹을 형성했다. 인간-기계 정렬 성능은 Table 4의 SRCC/PLCC에서 차원별로 0.75~0.83 범위의 상관을 보였고, Expression/Lighing/Materiality 등 주요 차원에서 높은 상관을 확인하였다. Figure 7은 인간 전문가 평가와 EvalVerse 예측 간의 쌍별 win-ratio를 산점으로 시각화하여 강한 선형 상관성을 증명한다.
관련 Figure

Figure 6은 Text-to-Video(R2V) 설정에서 다수 모델의 세부 평가지표를 비교하며 Seedance 2.0이 전반적으로 상위권에 있다. Kling-v3-Omni와 Happy Horse 1.0이 뒤를 잇는다.
R2V 설정에서 모델 간 미세 수행도 비교(레이더 차트)

Figure 7은 인간 전문가 평가와 EvalVerse 예측 간의 win-ratio를 모델별로 산점으로 보여 주며, 직선 피팅이 높은 상관성을 시사한다.
Human-Machine Alignment 시각화 산점도(Figure 7)
기술 상세
전문가-주도 보정(CoT)과 데이터 주입(SFT)을 통해 모델의 추론 로직과 판단 기준을 정렬한다. Perception Extractor는 cross-frame Identity Tracking, semantic anchoring, Audio-Visual Sync, Speech Emotion Recognition 등 다수의 연산자를 포함한다. SFT는 데이터 분포를 모델 매개변수에 직접 주입해 추상 차원의 판단으로 인한 편차를 줄이며, Self-Reflection 모듈로 CoT의 내부 재검증을 수행한다. Igate를 통해 맥락에 따라 특정 측정치를 우회하는 동적 게이팅을 적용한다.
실무 활용
EvalVerse는 RL 보상 모델 학습에 고품질의 피드백 벡터를 공급하고, 에이전트 기반 비디오 생성 파이프라인의 전문 평가자로 활용될 수 있다.
- RL 기반 비디오 생성 모델의 보상 신호로 활용하여 더 높은 시네마틱 품질을 유도
- 에이전트 시나리오에 특화된 다중샷 및 오디오-비주얼 관리 정책 평가
- 대규모 영상 생성 벤치마크의 표준화된 전문가 근거 점수 체계 제공
- 실무 프로덕션에 맞춘 도메인 특화 평가 도구로 활용
- 다양한 스타일/장르에 대한 전문가 기반 점수 분포를 파라미터로 주입하는 선제적 품질 제어
코드 공개 여부: 미확인
키워드
용어 해설
- 파이프라인 인식 분류학(Pipeline-Aware Taxonomy)
- — EvalVerse의 핵심 아이디어를 프리프로덕션/프로덕션/포스트프로덕션의 흐름에 맞춰 다층적으로 정의하고, 시네마틱 요소를 196개의 래셔날로 구체화한 계층적 분류체계다.
- Real-to-Gen 데이터 엔진(Real-to-Gen Data Engine)
- — 대규모 전문 데이터베이스에서 다중 모달 메타데이터를 추출하고 테스트 페어를 생성하는 엔진으로, 실제 프로덕션 데이터의 분포를 반영한 학습/평가 샘플을 확보한다.
- 전문가 보정된 Chain-of-Thought(Expert-Calibrated Chain-of-Thought)
- — 도메인 전문가의 지식을 반영한 CoT를 이용해 VLM의 추론 과정을 단계별로 서술하도록 보정하며, 인간 평가 기준과의 일치를 확보한다.
- 두 단계 파인튜닝(Two-Stage Fine-Tuning)
- — VLM에 대해 먼저 선호 관계를 학습하고(sampling), 이후 점수화에 필요한 절대 점수를 학습하도록 두 단계로 파인튜닝하여 추상적 차원의 평가 기준을 정량화한다.
- 보상 모델 학습(Reward Model Training)
- — 강화학습에서 사용할 고품질 보상 벡터를 생성하기 위한 학습으로, 전문가 평가 분포를 파라미터에 주입해 RL 신호를 향상시킨다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
