본문으로 건너뛰기
HF Daily Papers조회 1

MSAVBench: 다중 샷 오디오-비디오 생성의 포괄적이고 신뢰할 수 있는 평가를 위한 벤치마크

현존 벤치마크는 데이터 다양성·생성 설정의 확장성 면에서 한계가 있다. MSAVBench는 비디오, 오디오, 샷 수, 레퍼런스의 네 차원에 걸친 포괄적 커버리지를 제공하고, 샷 경계의 self-correction과 주관 지표의 인스턴스-루브릭 기반 평점, 외부 도구를 활용한 증거 기반 평가를 도입해 현대 MSAV 모델의 다면적 성능을 더 신뢰성 있게 측정한다. 또한 19개 모델에 대한 체계적 비교를 통해 공개형 파이프라인의 개선 가능성과 현행 시스템의 한계를 진단한다.

추가 이미지 분석

Figure 2는 프롬프트 분포와 주제 간 균형, 샷 수 분포 등 데이터 다양성의 분포를 시각화한다.
Chart

데이터 구성의 다양성과 난이도 구성의 실질적 범위를 보여주며, 286 프롬프트/2198샷의 스케일과 다층적 품질 평가의 근거를 제공한다.

Figure 2는 프롬프트 분포와 주제 간 균형, 샷 수 분포 등 데이터 다양성의 분포를 시각화한다.

Figure 6은 프롬프트Suite의 샷 스케일, 카메라 각도, 트랜지션, 톤/색채의 분포를 차트로 제시한다.
Chart

샷 구성의 다양성과 시네마틱 언어의 분포를 보여주며, 평가 지표의 다차원적 특성을 시각적으로 보강한다.

Figure 6은 프롬프트Suite의 샷 스케일, 카메라 각도, 트랜지션, 톤/색채의 분포를 차트로 제시한다.

용어 해설

샷 분할(Shot Segmentation)
샷 단위로 비디오를 구분하는 작업으로, MSAVBench는 이 경계가 정확해야 평가의 신뢰성이 높아지므로 self-correction 도구를 통해 경계를 보정한다.
립 싱크(Lip Synchronization)
대사와 입 모양의 시각적 일치를 측정하는 기술로, MSAVBench는 Lip synchronization 지표를 개별 샷에서 평가하고 전체 비주얼-오디오 정합성의 핵심 척도로 삼는다.
도구 기반 증거(Tool-Grounded Evidence)
외부 도구(객체 탐지기, 포즈 추정기 등)의 증거를 평가에 반영하는 방식으로, 다중 모달 평가의 신뢰성을 높인다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 19.수집 2026. 05. 21.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.