본문으로 건너뛰기

MMOU: 길고 복잡한 실제 영상의 전방위 이해 및 추론을 위한 대규모 멀티태스크 벤치마크

기존 비디오 벤치마크는 주로 짧은 클립이나 단일 모달리티에 집중하여 실제 환경의 복잡성을 반영하지 못했다. MMOU는 시각과 오디오가 결합된 최장 2시간의 영상을 통해 모델이 인간처럼 다각도로 추론할 수 있는지 엄격하게 평가하며, 현재 최신 모델들도 인간 수준(84.3%)에 크게 못 미치는 성능(최대 64.2%)을 보임을 입증했다.

용어 해설

멀티모달 대형 언어 모델(MLLM)
텍스트뿐만 아니라 이미지, 오디오, 비디오 등 다양한 형태의 데이터를 동시에 처리하고 이해할 수 있는 AI 모델이다. 여러 감각 정보를 통합하여 인간과 유사한 다각적 추론을 수행하는 것이 핵심 목표다.
참조 접지(Referential Grounding)
언어적 표현이 실제 영상이나 이미지 내의 어떤 구체적인 객체나 사건을 가리키는지 정확히 연결하는 기술이다. 멀티모달 모델이 텍스트와 시각 정보를 얼마나 일관되게 매핑하는지 평가하는 척도가 된다.
건초더미에서 바늘 찾기(Needle-in-a-Haystack)
방대한 데이터 속에서 아주 작고 구체적인 정보를 정확히 찾아내는 능력을 의미한다. 비디오 AI에서는 수십 분의 영상 중 단 몇 초간 발생하는 사건을 기억하고 추론하는 능력을 평가할 때 사용된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 15.수집 2026. 03. 18.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.