섹션별 상세
기존 비디오 QA 벤치마크는 모델이 정확한 시공간적 근거 없이 정답을 맞히는 '지식 편향'이나 '우연한 일치'를 걸러내지 못하는 문제를 안고 있다. VideoZeroBench는 질문에 대응하는 정확한 시간적 구간과 공간적 바운딩 박스를 증거로 요구하여 모델의 실제 이해도를 엄격하게 검증한다.
연구팀은 답변 생성, 시간적 접지(Temporal Grounding), 공간적 접지(Spatial Grounding)를 분리하여 평가하기 위해 5단계 계층적 프로토콜을 설계했다. 각 단계는 단순 QA에서 시작해 최종적으로 정답과 시공간적 위치를 모두 정확히 맞춰야 하는 수준까지 요구 사항을 강화한다.
성능 평가 결과, 최첨단 모델인 Gemini-3-Pro조차 표준 QA 설정(Level-3)에서 17% 미만의 정확도를 보였으며, 시공간 접지가 필수인 Level-5에서는 모든 모델이 1% 미만의 성적을 거뒀다. 이는 대다수 모델이 정답은 맞히더라도 그 근거가 되는 영상 내 위치를 전혀 파악하지 못하고 있음을 증명한다.
VideoZeroBench는 13개 도메인에 걸친 500개의 고품질 수동 주석 데이터를 제공하여 장기 비디오 이해의 한계를 정밀하게 타격한다. 이를 통해 모델의 원자적 능력과 추론 패러다임을 분석함으로써 향후 근거 기반 비디오 추론 연구를 위한 구체적인 방향성을 제시한다.
용어 해설
- 시공간적 접지(Spatio-Temporal Grounding)
- — 비디오 내에서 특정 사건이 발생하는 정확한 시간 구간(Temporal)과 해당 객체가 위치한 공간적 영역(Spatial)을 찾아내는 기술이다. 모델이 단순히 정답을 맞히는 것을 넘어 영상의 어느 부분을 보고 판단했는지 증명하는 핵심 지표로 활용된다.
- 비디오 멀티모달 거대 언어 모델(Video MLLM)
- — 텍스트와 비디오 데이터를 동시에 처리하고 이해할 수 있는 거대 언어 모델이다. 영상의 프레임 간 관계를 파악하여 복잡한 질문에 답하거나 내용을 요약하는 능력을 갖추고 있다.
- 바운딩 박스(Bounding Box)
- — 이미지나 영상 프레임 내에서 특정 객체의 위치를 사각형 형태로 표시한 경계 영역이다. 모델이 객체를 정확히 인식하고 추적하고 있는지 평가하는 공간적 근거로 사용된다.
기술
- Gemini-3-Pro
- VideoZeroBench
활용 사례
- 비디오 모델의 추론 능력 정밀 평가
- 근거 기반 비디오 이해 시스템 구축
- 장기 비디오 데이터셋 벤치마킹
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 02.수집 2026. 04. 04.출처 타입 PAPER
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
