TL;DR
다중 참조를 조건으로 하는 오디오·비디오 생성(MR2AV)은 단일 텍스트나 단일 이미지 조건보다 참조들 간의 관계 이해와 참조 대상의 정확한 바인딩을 요구한다. 기존 벤치마크는 단일 참조나 텍스트 중심 평가에 머물러 MR2AV의 핵심 실패 모드를 포착하지 못했으므로, 이 논문은 MR2AV 특유의 참조 결합·자연스러운 통합·멀티모달 정합을 따로 떼어 정량화할 수 있는 도구를 제공했다. 따라서 연구자와 엔지니어가 참조 보존, 음성-시각 동기화, 지침 준수 등 개별 역량을 진단하고 개선 우선순위를 정할 수 있게 됐다.
왜 중요한가
다중 참조를 조건으로 하는 오디오·비디오 생성(MR2AV)은 단일 텍스트나 단일 이미지 조건보다 참조들 간의 관계 이해와 참조 대상의 정확한 바인딩을 요구한다. 기존 벤치마크는 단일 참조나 텍스트 중심 평가에 머물러 MR2AV의 핵심 실패 모드를 포착하지 못했으므로, 이 논문은 MR2AV 특유의 참조 결합·자연스러운 통합·멀티모달 정합을 따로 떼어 정량화할 수 있는 도구를 제공했다. 따라서 연구자와 엔지니어가 참조 보존, 음성-시각 동기화, 지침 준수 등 개별 역량을 진단하고 개선 우선순위를 정할 수 있게 됐다.
핵심 기여
350개 표본으로 구성된 MR2AV 전용 벤치마크 구축
MultiRef-Compass는 총 350개의 엄선된 샘플을 포함하며 보드별로 동일-다중뷰, 이종 엔티티 결합, 다중 주체 시나리오를 포괄한다. 자산 팩은 주체·객체·장면·비디오·보이스로 구성되어 재사용 가능한 조합 파이프라인을 통해 샘플을 생성한다. 프롬프트는 구조화된 스키마와 GPT-5.5 기반 생성·검증을 거쳐 메타데이터와 연동되는 평가 라우터를 지원한다.
자동 지표와 재심판(리저징) 강화된 MLLM 판정의 하이브리드 평가 프레임워크
평가는 기본 품질(Basic Quality), 참조 일관성(Reference Consistency), 음성-시각 정합(Audio-Visual Consistency), 지침 준수(Instruction Following)의 네 차원과 14개 하위 지표로 구성된다. 자동 도구(DOVER++, Audiobox, LatentSync, ECAPA-TDNN 등)를 가능한 항목에 적용하고, MLLM 기반 체크리스트와 루브릭으로 섬세한 항목을 채점한다. 초기 판정 후 동일 문항의 모델 간 일관성 문제를 가려내는 재심판 단계를 적용해 항목 수준의 신뢰도를 향상시켰다.
임베딩 유사도 과대평가를 보정하는 Paste-Naturalness 계수 도입
Entity Fidelity의 자동 유사도(EF_base)는 참조를 그대로 복사한 경우에도 높게 나오므로, MLLM-추정의 P_paste(r) ∈ [0,1]을 곱해 최종 점수 EF_final = EF_base × P_paste(r)로 보정한다. 이 보정은 복사-붙여넣기 아티팩트를 완화해 임베딩 기반 지표의 순위를 실제 합성 자연스러움과 더 잘 정렬시켰다. 보정 결과로 SkyReels-V3 같은 모델의 과대평가 사례가 랭킹에서 하향 조정됐다.
다양한 공개·비공개 MR2AV 시스템에 대한 대규모 평가 실행과 진단 결과 공개
논문은 Seedance 2.0, Kling 3.0, HappyHouse 1.1, Gemini-Omni, Wan 2.7, Vidu Q3-Mix, Wan2.1-VACE, SkyReels-V3 등 8개 시스템을 동일 입력 조건에서 비교했다. 실험은 A800 GPU에서 실행되었고, 모델별로 10초·1080p 출력(플랫폼 제약시 권장 설정)을 사용해 결과의 실용적 차이를 반영했다. 결과는 모델별로 네 차원에서 상이한 강·약점을 드러내며, 특히 참조 결합과 지침 준수에서 현저한 개선 여지가 있음을 확인했다.
핵심 아이디어 이해하기
문제의 출발점은 다중 참조를 조건으로 한 생성에서 요구되는 '교차-참조 이해'와 '조합적 바인딩' 능력이다. 동일 인물의 여러 뷰가 주어질 때 모델은 이를 동일 인물의 시점 변형으로 해석해야 하고, 서로 다른 엔티티 참조가 주어질 때는 해당 엔티티를 지정된 역할과 상호작용으로 연결해야 한다. 단순 임베딩 유사도만으로는 뷰 혼동(identity splitting)이나 복사-삽입 아티팩트를 분별하지 못하므로 다층적 진단이 필요하다.
방법론
MultiRef-Compass는 자산 팩 구성, 보드별 자산 조합, 구조화된 프롬프트 생성의 세 단계 파이프라인으로 데이터셋을 구축했다. 자산 팩은 주체(subject), 객체(object), 장면(scene), 비디오, 보이스로 분류되며 주체 팩은 비디오에서 다중 뷰를 추출하거나 AIGC를 통해 보조 참조를 생성하여 3~6개의 보기를 확보한다. 보드 구성은 동일-다중뷰(B1), 이종 조합(B2), 다중 주체(B3)로 구분되며 확장 보드(B4)는 오디오·비디오 참조를 포함해 티엠버 보존을 평가한다.
관련 Figure

이 도식은 자산-재사용(Asset-pack) 기반의 입력 구성과 구조화된 프롬프트가 생성 파이프라인으로 흘러가는 전체 프로세스를 시각적으로 제시한다. 또한 자동 지표와 MLLM-as-a-Judge의 결합, 그리고 재심판(rejudging) 단계가 어떻게 평가 신뢰도를 보정하는지 단계별로 보여준다. 이 그림은 논문의 방법론 섹션에서 제안한 하이브리드 평가 체계와 데이터 생성 구조를 직접적으로 보강한다.
MultiRef-Compass의 전체 프레임워크 개요를 도식화한 그림으로 데이터 구축, 참조 입력, 생성 결과, 평가 차원과 재심판 흐름을 보여준다.

이 그림은 주체 팩, 객체 팩, 장면 팩, 비디오·보이스 팩이 어떻게 선별되고 보드별로 조합되어 샘플이 생성되는지를 단계별로 정리한다. 또한 GPT-5.5 기반 프롬프트 생성과 인간 검증 절차가 포함되어 있어 샘플의 재현성과 메타데이터 연계를 가능하게 하는 구현 세부를 시각적으로 확인할 수 있다. 데이터 구축과 관련된 구체적 제약과 확장 포인트를 명확히 전달한다.
데이터 구성 파이프라인을 상세히 나타낸 그림으로 자산 팩과 보드별 구성, 프롬프트 생성 및 평가 라우터 흐름을 보여준다.

해당 차트는 벤치마크가 다양한 참조 구조를 포함함을 수치로 확인하게 해 주며, 동일인물 참조와 다중 엔티티 조합이 주요 샘플 유형임을 보여준다. 이 분포는 평가가 참조 결합과 교차-참조 이해를 중점적으로 진단하도록 설계되었음을 뒷받침한다. 데이터 세부 통계는 샘플 설계의 균형성과 난이도 조절 근거가 된다.
벤치마크의 참조 구조 분포를 원형 차트로 나타낸 그림으로 동일-다중뷰, 인간-인간-객체 등 구성 비율을 보여준다.

차트는 샘플의 30%가 사운드+대사, 23%가 대사 전용 등 음향 요구 사항의 다양성을 수치로 보여준다. 이 통계는 Audio-Visual Consistency 및 Instruction Following 항목 활성화 비율을 결정하는 근거가 된다. 음향 분포는 다양한 오디오 조건에서 모델의 타깃별 능력을 평가하기 위한 설계적 근거를 제공한다.
오디오 설정 분포를 나타낸 원형 차트로 사운드·대사·음악 등 다양한 음향 구성이 포함된 비율을 표시한다.

해당 그래프는 프롬프트가 평균 600자 내외로 구성되며 외형 제약·멀티샷 요구 등 세부 조건이 상당 비율로 포함되어 있음을 수치로 나타낸다. 이러한 분포는 모델이 단순한 텍스트 지시를 넘어 세부 지시를 따르는 능력을 시험하도록 설계되었음을 의미한다. 프롬프트 특성은 평가 라우터가 활성화할 지표를 결정하는 주요 입력으로 작동한다.
프롬프트 길이 및 요구사항 분포를 보여주는 그래프로 평균 프롬프트 길이와 항목별 비율을 시각화한다.
주요 결과
벤치마크 통계상 전체 350개 샘플은 메인 보드 300개와 챌린지 보드 50개로 구성되며, 샘플의 70%는 실사 참조이고 30%는 만화 스타일 참조이다. 프롬프트 평균 길이는 약 600자이며 60%는 효과음 포함, 30%는 배경음악 포함, 70%는 대사 포함, 40%는 외형 제약, 30%는 멀티샷 구조 요구를 포함한다. 인간 선호와의 상관관계는 Pearson 기준으로 Basic Quality 0.8979, Reference Consistency 0.9380, Audio-Visual Consistency 0.9217, Instruction Following 0.9644로 보고되어 평가 체계가 사람 선호를 잘 반영함이 확인되었다.
관련 Figure

이 그래프는 다양한 모델이 Basic Quality, Reference Consistency, Audio-Visual Consistency, Instruction Following에서 균등하지 않은 성능 프로파일을 보인다는 사실을 강조한다. 특히 폐쇄형 프로프라이어터리 모델들이 전반적으로 더 높은 점수를 얻었음을 시사하며, 오픈소스 모델들은 참조 일관성과 지침 준수에서 열세를 보인다. 결과 해석은 모델별 강·약점을 구체적으로 진단하는 데 도움이 된다.
시스템별 주요 실패 유형과 점수 분포를 보여주는 가로 막대 그래프로 모델 간 성능 차이를 시각화한다.

레이더 차트는 Seedance 2.0이 전반적으로 균형 잡힌 성능으로 상위권을 차지하며, Gemini-Omni와 Kling이 특정 차원에서 강점을 보인다는 점을 명확히 보여준다. 이 시각화는 단일 수치 대신 차원별 프로파일을 제시해 모델들의 성능 포트폴리오를 비교하기 쉽게 한다. 또한 개별 차원에서의 상충(trade-off) 관계를 판단하는 데 유용한 근거를 제공한다.
여러 폐쇄형 모델의 네 차원 능력(BQ, RC, AVC, IF)을 레이더 차트로 비교한 그림으로 모델별 순위 분포를 시각화한다.

이 차트는 오픈소스 모델들이 폐쇄형 모델 대비 내부 링 쪽에 몰려 있음을 보여주며, 특히 Reference Consistency와 Instruction Following에서 큰 격차가 존재함을 드러낸다. 시각적으로 압축된 프로파일은 오픈소스 측에서 참조 결합 능력과 지침 준수가 주요 개선 포인트임을 암시한다. 벤치마크는 이러한 격차를 정량적으로 추적할 수 있는 도구로 작동한다.
오픈소스 모델(SkyReels-V3, Wan2.1-VACE)의 네 차원 능력을 비교한 레이더 차트로 전반적 한계를 시각화한다.
기술 상세
전체 아키텍처는 자산 팩 기반의 샘플 합성 파이프라인과 평가 파이프라인으로 분리되어 있다. 샘플 생성부는 패키지화된 주체·객체·장면·비디오·보이스 자산을 라우팅 규칙에 따라 보드별 구성으로 재조합하고, GPT-5.5를 사용해 모달리티별 필드(비디오·오디오·대사)를 합쳐 구조화된 프롬프트를 만든 뒤 인간 리뷰를 통해 접지(grounding)를 확인한다. 이러한 설계는 참조 구성·난이도·평가 활성화 규칙을 메타데이터로 기록해 평가 라우터가 적용 가능한 지표만 골라 자동·MLLM 평가를 수행하도록 한다.
한계점
MultiRef-Compass는 통제된 진단 벤치마크로 설계되어 모든 창작 도메인·문화 스타일·참조 모달리티를 포괄하지는 않는다. 평가 표준은 각 샘플을 최대 세 장의 참조 이미지로 표준화하므로 훨씬 큰 참조 집합에 대한 성능은 범위 외이다. 자동 증거 도구와 SLS 같은 동기화 지표는 동적 얼굴이나 만화풍 대상에서 한계가 있어 일부 샘플에서 편향된 점수를 줄 수 있음이 명시됐다.
실무 활용
MultiRef-Compass는 연구·제품 실험에서 다중 참조 기반 오디오·비디오 생성 시스템의 약점을 진단하는 실무용 평가 테이블로 활용될 수 있다. 구조화된 프롬프트와 메타데이터를 통해 특정 참조 구성이나 음성 요구사항을 표준화된 입력으로 재현할 수 있어 A/B 실험이나 품질 회귀 테스트에 적합하다. 저장소가 공개되어 있어 실험 파이프라인에 벤치마크를 직접 통합할 수 있다.
- 모델 개발자는 새로운 참조 합성 알고리즘을 도입할 때 참조 보존(EF), 바인딩(BC), 복사-붙여넣기 보정(P_paste) 등 세부 지표별 성능 변화를 검증할 수 있다.
- 품질 관리팀은 자동 지표와 MLLM 판정의 조합을 이용해 배치별 회귀를 탐지하고 재심판 과정을 통해 판정 일관성을 확보할 수 있다.
- 서비스 운영자는 멀티샷 흐름, 음향 효과 포함 여부, 특정 의상·소품 제약 등 프롬프트 요구사항 준수도를 정량적으로 모니터링해 정책·콘텐츠 파이프라인에 적용할 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- MLLM-as-a-Judge
- — 복수 모달 출력의 세부 항목을 채크리스트·루브릭으로 점수화하기 위해 대형 다중모달 언어모델을 평가자 역할로 사용하는 체계이다. 입력된 증거(비디오·오디오·프롬프트)와 체크리스트를 함께 제공해 1–5 MOS 점수를 산출하며, 불확실한 판정은 재심판(rejudging) 단계로 교정한다. 자동화된 확장성과 인간 선호와의 정렬을 동시에 목표로 하여 대규모 벤치마크 평가에 사용된다.
- Paste-Naturalness Coefficient
- — 자동 임베딩 유사도로 산출된 유사도 점수가 단순 복사(copy-and-paste)로 부풀려지는 현상을 보정하기 위해 도입된 계수이다. EF_base에 곱해 최종 Entity Fidelity를 얻으며, 보정값이 0에 가까우면 복사 흔적이 강하다고 판단된다. 임베딩 기반 지표의 과대평가를 완화해 실제 합성 품질을 더 잘 반영하는 데 목적이 있다.
- LatentSync
- — 대화가 포함된 샘플에서 얼굴 전면성 여부를 먼저 필터링한 뒤, 음성과 입 모션의 시간적 동기화를 잠재 공간 특성을 이용해 정량화하는 방법이다. 안정적인 전면 얼굴에서만 적용하여 자동 측정의 신뢰도를 높이며, 주로 SLS 평가에 사용된다. 동적 얼굴이나 다중 화자 장면에서는 민감도가 떨어질 수 있다.
- ECAPA-TDNN
- — 화자 특성(티엠버)을 비교하기 위해 사용하는 음성 임베딩 네트워크로, 입력 음성에서 스피커 임베딩을 추출해 유사도를 계산한다. MultiRef-Compass에서는 보이스 레퍼런스가 주어진 경우 생성 음성의 티엠버 유사도를 측정하는 Timbre Similarity에 적용됐다. 음성 전처리와 보정 절차를 거쳐 보정된 유사도 점수를 산출한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.