본문으로 건너뛰기

LongAV-Compass: Minute-scale Audio-Visual Generation을 위한 통합 평가 벤치마크

짧은 클립 중심의 평가에서 벗어나 분 단위의 오디오-비주얼 생성은 지속적인 정체성 유지, 내러티브 흐름, 오디오-비주얼 동기화를 요구한다. LongAV-Compass는 텍스트/이미지/비디오 입력을 아우르는 Unified X2AV 평가 체계를 제시하고, 284개 테스트 케이스로 긴 형식에서의 실패 모드와 한계점을 진단한다. GEMINI 3.1 Pro 기반의 MLLM 평가와 DINO-v2, CLIP, ImageBind 등 다중 모달 지표를 결합하여 다차원적인 진단을 가능하게 한다.

용어 해설

이벤트 수준 주석(Event-Level Annotation)
두 개의 상호 연관된 표현 방식으로 각 사례를 글로벌 설명과 이벤트 시퀀스로 구성하고, 이벤트 단위로 평가할 수 있게 하는 주석 체계. 각 이벤트는 시간 범위, 행위 요약, 완료 기준, 시각 요소, 오디오 내용을 포함한다.
시맨틱 정합성(Semantic Alignment)
텍스트 설명(또는 프롬프트)와 생성된 영상 간 의미적 일치 정도를 측정하는 프레임워크의 구성 요소.
오디오-비주얼 동기화(Audio-Visual Synchronization)
generated 오디오 트랙이 시각적 이벤트와 시간적으로 일치하도록 유지하는 특성. LongAV-Compass의 AVS 지표로 측정.
LLM 보조 평가(LLM-assisted Assessment)
다중 모달 신호를 평가하는 데 Gemini 3.1 Pro 같은 대형 다중모달 모델을 활용하는 평가 접근법.
이벤트 경계의 안정성(Event-Boundary Stability)
이벤트 간 전환에서 생기는 블랙 프레임, 깜박임, 중복 등 불연속 현상을 최소화하는 평가 지표.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 25.수집 2026. 05. 28.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.