본문으로 건너뛰기

MultiRef-Compass: 다중 참조 기반 오디오-비디오 생성의 포괄적 평가 벤치마크

MultiRef-Compass는 350개 샘플과 재심판을 포함한 MLLM 기반 평가체계를 결합해 다중 참조 조건에서 오디오·비디오 생성의 참조 보존, 참조 바인딩, 음성-시각 정합 및 지침 준수 능력을 정량적으로 진단하는 벤치마크이다. 이 데이터셋은 보드별 자산 조합과 구조화된 프롬프트로 구성되어 동일 대상의 다중 뷰와 이종 엔티티 결합을 체계적으로 평가한다. 자동 지표와 MLLM 채점의 결합으로 사람 선호와 높은 상관을 확보했다.

용어 해설

대형 다중모달 언어모델 판정자(MLLM-as-a-Judge)
복수 모달 출력의 세부 항목을 채크리스트·루브릭으로 점수화하기 위해 대형 다중모달 언어모델을 평가자 역할로 사용하는 체계이다. 입력된 증거(비디오·오디오·프롬프트)와 체크리스트를 함께 제공해 1–5 MOS 점수를 산출하며, 불확실한 판정은 재심판(rejudging) 단계로 교정한다. 자동화된 확장성과 인간 선호와의 정렬을 동시에 목표로 하여 대규모 벤치마크 평가에 사용된다.
복사-자연스러움 보정계수(Paste-Naturalness Coefficient)
자동 임베딩 유사도로 산출된 유사도 점수가 단순 복사(copy-and-paste)로 부풀려지는 현상을 보정하기 위해 도입된 계수이다. EF_base에 곱해 최종 Entity Fidelity를 얻으며, 보정값이 0에 가까우면 복사 흔적이 강하다고 판단된다. 임베딩 기반 지표의 과대평가를 완화해 실제 합성 품질을 더 잘 반영하는 데 목적이 있다.
잠재공간 기반 립싱크 측정법(LatentSync)
대화가 포함된 샘플에서 얼굴 전면성 여부를 먼저 필터링한 뒤, 음성과 입 모션의 시간적 동기화를 잠재 공간 특성을 이용해 정량화하는 방법이다. 안정적인 전면 얼굴에서만 적용하여 자동 측정의 신뢰도를 높이며, 주로 SLS 평가에 사용된다. 동적 얼굴이나 다중 화자 장면에서는 민감도가 떨어질 수 있다.
음성 임베딩용 ECAPA-TDNN(ECAPA-TDNN)
화자 특성(티엠버)을 비교하기 위해 사용하는 음성 임베딩 네트워크로, 입력 음성에서 스피커 임베딩을 추출해 유사도를 계산한다. MultiRef-Compass에서는 보이스 레퍼런스가 주어진 경우 생성 음성의 티엠버 유사도를 측정하는 Timbre Similarity에 적용됐다. 음성 전처리와 보정 절차를 거쳐 보정된 유사도 점수를 산출한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 15.수집 2026. 07. 18.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.