TL;DR
짧은 클립 중심의 평가에서 벗어나 분 단위의 오디오-비주얼 생성은 지속적인 정체성 유지, 내러티브 흐름, 오디오-비주얼 동기화를 요구한다. LongAV-Compass는 텍스트/이미지/비디오 입력을 아우르는 Unified X2AV 평가 체계를 제시하고, 284개 테스트 케이스로 긴 형식에서의 실패 모드와 한계점을 진단한다. GEMINI 3.1 Pro 기반의 MLLM 평가와 DINO-v2, CLIP, ImageBind 등 다중 모달 지표를 결합하여 다차원적인 진단을 가능하게 한다.
왜 중요한가
짧은 클립 중심의 평가에서 벗어나 분 단위의 오디오-비주얼 생성은 지속적인 정체성 유지, 내러티브 흐름, 오디오-비주얼 동기화를 요구한다. LongAV-Compass는 텍스트/이미지/비디오 입력을 아우르는 Unified X2AV 평가 체계를 제시하고, 284개 테스트 케이스로 긴 형식에서의 실패 모드와 한계점을 진단한다. GEMINI 3.1 Pro 기반의 MLLM 평가와 DINO-v2, CLIP, ImageBind 등 다중 모달 지표를 결합하여 다차원적인 진단을 가능하게 한다.
핵심 기여
minute-scale AV 벤치마크 도입
T2AV/I2AV/V2AV를 아우르는 최초의 minute-scale 오디오-비주얼 생성 벤치마크로 284개 테스트 케이스를 제공한다. 4개의 애플리케이션 시나리오와 4개의 생성 복잡도 레벨(L1–L4)을 포함한다.
통합 평가 프레임워크
20개 이상의 세부 지표로 구성된 프레임워크를 제시하고, Within-Segment, Cross-Segment, Global Narrative의 다층 평가를 수행한다. 오디오-비주얼 동기화와 입력 조건에 따른 시맨틱 정합도까지 포함한다.
LLM 중심의 진단 모듈
Gemini 3.1 Pro를 기반으로 이벤트 수준 평가와 텍스트-비디오 정합 평가를 수행하고, DINO-v2/CLIP/ImageBind과의 보완적 도구로 진단의 신뢰성을 강화한다.
대표 모델 다각도 평가 및 분석
11종의 대표 모델을 평가하여, 특정 지표에서의 강점이 다른 지표에는 전가되지 않는 현상을 드러내고, Long-form 생성의 한계점(예: Identity drift, 위치 전환의 brittle한 구간) 등을 진단한다.
재현성 및 공개 계획
task annotations, 원시 MLLM JSON 출력, 평가 루프 등을 공개하고, 향후 재현과 재평가를 가능하게 한다.
핵심 아이디어 이해하기
- 문제 정의: 분 단위의 오디오-비주얼 생성은Subject identity, 사건 간 연결성, 시퀀스의 안정성, 오디오의 지속성 등 긴 시간 축의 요인을 함께 관리해야 한다. 기존 단편 벤치마크는 이러한 장기 의존성을 충분히 포착하지 못한다. 2) 해결 원리: LongAV-Compass는 application scenario와 generation complexity의 2축 분류 체계를 도입하고, 세 가지 입력조건(T2AV/I2AV/V2AV)을 하나의 평가 프레임워크로 통합한다. 글로벌 설명과 이벤트 시퀀스의 이중 주석 형식을 통해 고수준 서사 구조와 이벤트 수준 진단을 동시에 가능하게 한다. 3) 차별성: 20+ 차원의 다면적 지표로 Within-segment 품질, Cross-segment 일관성, Global Narrative의 종합적 품질을 동시에 측정하고, 오디오-비주얼 동기화 및 입력 조건에 따른 시맨틱 정합까지 포섭한다. 4) 기대 효과: 단일 점수 대신 다차원 진단을 통해 현재 모델의 강점과 취약점을 식별하고, 장기 구간에서의 Identity drift 및 전환 실패 같은 문제를 해결하기 위한 구체적 설계 방향을 제시한다.
방법론
데이터 구성/주석: LongAV-Compass는 T2AV(128), I2AV(115), V2AV(41)로 구성된 284샘플을 보유한다. Task별 데이터 파이프라인: T2AV는 실영상의 Transcription과 LLM 템플릿 생성의 두 경로를 가진다. I2AV는 이미지 priors를 추출하고 LLM 템플릿에서 이벤트 스크립트를 생성한다. V2AV는 10–15초 레퍼런스 비디오를 제공하고 남은 45–50초의 continuation 스크립트를 Gemini 3.1 Pro가 생성한다. 주석 포맷은 글로벌 DESCRIPTION + 이벤트 시퀀스의 이중 표현으로 구성되며, identity/physical constraints 및 narrative dependencies를 포함한다. 평가 프레임워크: 영상은 6개 공유 차원(Video) + 3개 오디오 차원으로 구성된 다차원 지표로 평가한다. Event Fulfillment(VQA): 이벤트별 QA 체크를 통해 요건 충족 여부를 판단하고 결과를 0~1 스케일로 정규화한다. VQ, Cont., Trans., Hol., TVAlign을 포함한 하위 지표가 있다. Audio(AudS/ AudQ/ AudL): AVS(1–5), AudQ(1–5), AudL(1–5)로 평가한다. I2AV의 경우 IV1(First-frame Anchoring)과 ImgAlign(참조 이미지 지속성)도 측정한다. V2AV는 Continuation과 Reference-Consistency를 포함한 영상-주제 동기화를 평가한다. 보고 프로토콜: 평가 범위를 Task별로 확장하되, 이벤트 정렬된 세그먼트를 사용해 경계 전환의 안정성 및 장기 구성의 품질을 구분한다. 재현성: Gemini 3.1 Pro의 버전/시점과 API 스냅샷을 기록하고 CSV/JSON 형태로 공개한다.
관련 Figure

벤치마크의 구성 요소와 평가 흐름을 한 눈에 파악할 수 있게 하며, X2AV의 통합 평가와 계층적 진단의 연결 고리를 시각화한다.
LongAV-Compass의 전체 구조를 보여주는 다이어그램

차원별 진단 보고서의 구조를 보여주며, 차원 간 비교가 가능하도록 구성되어 있다.
차원별 진단 리포트를 시각화한 오버레이 다이어그램

데이터 파이프라인(T2AV/I2AV/V2AV)과 데이터 생성 흐름, 주석 공유를 통한 품질 관리 흐름을 제시한다.
LongAV-Compass의 데이터 구성 파이프라인
주요 결과
주요 벤치마크 결과(T2AV/I2AV/V2AV) 및 Ablation/분석. T2AV에서 Seedance 2.0은 VQA=0.9023, VQ=3.7116, Cont.=4.2649, Trans=4.0065, Hol.=4.1128, TVAlign=0.6183, AVS=3.6038, AudQ=3.7875, AudL=4.1845로 가장 안정적인 오디오-비주얼 전체 품질을 보였고, Kling 3.0은 VQA=0.9274, Cont.=4.4139로 이벤트 충족과 장기 일관성을 강하게 보였다. Veo 3.1은 VQA=0.7784, VQ=2.8961, Cont.=3.1348, Trans=4.0032로 특정 축에서 강점을 보이나 전반적 지표는 하락했다. I2AV에서는 Seedance 2.0이 여전히 강하고, IV1( First-frame Anchoring ) 및 ImgAlign에서도 높은 점수를 보였으나 Event Fulfillment/Continuity와의 종합적 성과는 제약을 보였다. V2AV에서 Seedance 2.0이 모든 차원에서 우위였고, Veo 3.1은 Continuity/Alignment에서 강점이 있지만 Continuity/전환에서 큰 약점을 보였다. 오디오-비주얼 동시성은 오디오가 탑재된 모델에서도 장기 구간에서 강도 차이가 나타난다. 분석 결과, task-specific alignment 지표는 포화되거나 좁은 범위에서 변동하는 반면, Event Fulfillment, Cont., Hol.은 긴 형식의 품질 구분에 더 유효한 신호를 제공한다. 또한 네이티브 오디오 지원만으로는 항상 일관된 사운드를 보장하지 않는다. 입력 포맷별 민감도 분석에서 V2AV가 가장 많은 정보를 제공하는 반면, 최적 포맷은 모델 의존적이다. Human-alignment 연구에서 40개 사례를 추가 평가한 결과, 콘텐츠 충족도, 시각적 품질, 장기 안정성에 대해 벤치마크 점수와 인간 선택 간 상관관계가 높아 벤치마크의 신뢰도가 확인되었다.
관련 Figure

시나리오별 모델 성능 차이를 시각적으로 보여주며, Seedance 등 모델 간 강점 차이를 확인 가능하다.
T2AV 시나리오/모델 점수 그래프

I2AV에서의 영상-이미지 정합과 이벤트 진행의 차이를 비교해 준다.
I2AV 시나리오/모델 점수 그래프

이 사례에서 Identity 유지, 제품 인터랙션, 전환 장면의 연속성 등 생성 도전에 대한 시각적 진단 포인트를 제공한다.
T2AV Performance Ads 사례의 키프레임 시각화

제조사형 모델들의 다차원 능력치를 한 눈에 비교하기 위한 도식으로, 다른 모델과의 상대적 차이를 시각적으로 전달한다.
프로프라이어터리 모델의 capability radar

오픈소스 모델들의 다차원 능력치를 비교하여 지역별 강점/약점을 시각화한다.
오픈소스 모델의 capability radar
기술 상세
아키텍처적으로 LongAV-Compass는 T2AV/I2AV/V2AV를 하나의 벤치마크 프레임워크 아래 묶고, 4개의 시나리오와 4개의 난이도(L1–L4)로 구성된 이원적 taxonomy를 사용한다. 데이터 construction은 실영상 transcription과 LLM 템플릿, 또는 이미지 priors를 결합한 다경로 파이프라인으로 구성되며, V2AV의 경우 10–15초의 레퍼런스 비디오를 바탕으로 45–50초의 continuation 스크립트를 생성한다. 주석 포맷은 글로벌 description + 이벤트 시퀀스로 구성되며, 각 이벤트는 시간 범위, 행동 요약, 완료 기준, 시각 요소, 오디오 내용을 포함한다. 평가 메트릭은 6개의 비디오 지표(Event Fulfillment, VQ, Cont., Trans, Hol., TVAlign)와 3개의 오디오 지표(AVS, AudQ, AudL)로 구성되며, I2AV의 경우 IV1/ImgAlign 같은 태스크 특화 지표가 추가된다. 학습/구현은 GPU H200에서 수행되며, 모든 프롬프트 입력은 벤치마크 주석에 기반해 동일 prompts를 사용하되 모델 인터페이스에 맞게 형식화한다. 재현성 확보를 위해 모델 버전/API 스냅샷까지 기록하고 공개한다.
실무 활용
LongAV-Compass는 분 단위 AV 생성의 전반적 평가 진단 도구로 활용될 수 있다. 벤치마크를 통해 각 모델의 강점과 한계를 구체적으로 파악하고, 특정 시나리오에서의 내러티브 구성 및 오디오-비주얼 동기화 개선점을 도출한다.
- 신규 AV 생성 모델의 다축 성능 비교 및 모델 개선 방향 제시
- 장시간 내러티브 영상 생성의 Identity drift 및 전환 안정성 진단
- 온라인 시스템에서의 입력 포맷에 따른 성능 차이 분석
- 제품/브랜드 광고 같은 상업용 시나리오에서의 스토리텔링 품질 평가
- 오디오-비주얼 동기화 품질의 모델 간 차이 분석
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Event-Level Annotation
- — 두 개의 상호 연관된 표현 방식으로 각 사례를 글로벌 설명과 이벤트 시퀀스로 구성하고, 이벤트 단위로 평가할 수 있게 하는 주석 체계. 각 이벤트는 시간 범위, 행위 요약, 완료 기준, 시각 요소, 오디오 내용을 포함한다.
- Semantic Alignment
- — 텍스트 설명(또는 프롬프트)와 생성된 영상 간 의미적 일치 정도를 측정하는 프레임워크의 구성 요소.
- Audio-Visual Synchronization
- — generated 오디오 트랙이 시각적 이벤트와 시간적으로 일치하도록 유지하는 특성. LongAV-Compass의 AVS 지표로 측정.
- LLM-assisted Assessment
- — 다중 모달 신호를 평가하는 데 Gemini 3.1 Pro 같은 대형 다중모달 모델을 활용하는 평가 접근법.
- Event-Boundary Stability
- — 이벤트 간 전환에서 생기는 블랙 프레임, 깜박임, 중복 등 불연속 현상을 최소화하는 평가 지표.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.