본문으로 건너뛰기

LVOmniBench: 옴니모달 LLM을 위한 장기 오디오-비디오 이해 평가의 개척

기존 AI 모델들은 5분 내외의 짧은 영상은 잘 이해하지만, 실제 세상의 긴 영상에서는 맥락을 놓치는 경우가 많다. 이 논문은 최대 90분에 달하는 긴 오디오-비디오 데이터를 통해 AI의 장기 기억과 복합 추론 능력을 정밀하게 측정하는 새로운 기준점을 제시하여 실무형 옴니모달 AI 발전을 가속화한다.

용어 해설

옴니모달 대형 언어 모델(Omnimodal LLM)
텍스트, 이미지, 비디오뿐만 아니라 오디오 신호까지 동시에 입력받아 통합적으로 이해하고 생성할 수 있는 인공지능 모델이다. 여러 감각 정보를 하나의 신경망에서 처리하여 인간과 유사한 다중 감각 인지 능력을 구현하는 것이 핵심이다.
시간적 국소화(Temporal Localization)
긴 영상이나 오디오 스트림 내에서 특정 사건이나 정보가 발생하는 정확한 시점을 찾아내는 기술이다. 수십 분 분량의 데이터에서 질문에 답하기 위한 핵심 구간을 식별해야 하므로 모델의 장기 기억과 정밀한 검색 능력이 요구된다.
교차 모달리티 정렬(Cross-modal Alignment)
서로 다른 형태의 데이터(예: 비디오의 시각 정보와 오디오의 소리 정보) 사이의 상관관계를 파악하여 의미적으로 연결하는 과정이다. 예를 들어 화면 속 인물의 입모양과 들리는 목소리를 일치시키거나, 배경 음악의 분위기와 영상의 시각적 톤을 연결하는 작업이 포함된다.
자동 음성 인식(ASR)
오디오 신호에서 사람의 말을 추출하여 텍스트로 변환하는 기술이다. 옴니모달 모델이 원시 오디오 신호를 직접 처리하지 못할 때, ASR을 통해 변환된 텍스트를 보조 정보로 활용하여 이해도를 높이기도 한다.

코드 예제

text
Question: <question>
Options: <options_str>
Select the best answer from the options above. Directly provide the letter representing your choice (A/B/C/D) and nothing else. Do not include the full text of the option; do not provide any explanation.

LVOmniBench 평가를 위해 사용된 표준 프롬프트 템플릿

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 20.수집 2026. 03. 21.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.