추가 이미지 분석

데이터 구성의 다양성과 난이도 구성의 실질적 범위를 보여주며, 286 프롬프트/2198샷의 스케일과 다층적 품질 평가의 근거를 제공한다.
Figure 2는 프롬프트 분포와 주제 간 균형, 샷 수 분포 등 데이터 다양성의 분포를 시각화한다.

샷 구성의 다양성과 시네마틱 언어의 분포를 보여주며, 평가 지표의 다차원적 특성을 시각적으로 보강한다.
Figure 6은 프롬프트Suite의 샷 스케일, 카메라 각도, 트랜지션, 톤/색채의 분포를 차트로 제시한다.
용어 해설
- 샷 분할(Shot Segmentation)
- — 샷 단위로 비디오를 구분하는 작업으로, MSAVBench는 이 경계가 정확해야 평가의 신뢰성이 높아지므로 self-correction 도구를 통해 경계를 보정한다.
- 립 싱크(Lip Synchronization)
- — 대사와 입 모양의 시각적 일치를 측정하는 기술로, MSAVBench는 Lip synchronization 지표를 개별 샷에서 평가하고 전체 비주얼-오디오 정합성의 핵심 척도로 삼는다.
- 도구 기반 증거(Tool-Grounded Evidence)
- — 외부 도구(객체 탐지기, 포즈 추정기 등)의 증거를 평가에 반영하는 방식으로, 다중 모달 평가의 신뢰성을 높인다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



