본문으로 건너뛰기

비디오 추론 지능 측정을 위한 대규모 벤치마크: VBVR (Very Big Video Reasoning)

비디오 모델의 시공간적 물리 이해와 논리적 추론 능력을 다각도로 평가하기 위한 대규모 벤치마크 스위트 VBVR이 발표되었다.

섹션별 상세

01
VBVR은 비디오 모델이 단순히 시각적으로 그럴듯한 영상을 생성하는 것을 넘어 시공간적 맥락과 물리적 인과관계를 정확히 이해하는지 측정하는 데 중점을 둔다.
02
데이터 엔진은 유체 확산(Fluid Diffusion), 도형 패턴 완성(Draw Next Sized Shape), 평면 왜곡 보정(Planar Warp) 등 구체적인 물리 및 논리 시나리오를 자동 생성하여 모델의 한계를 시험한다.
유체 확산 추론 과제의 시작 프레임으로 물이 담긴 비커 위에 잉크 방울이 떨어지기 직전의 모습이다.
Screenshot물리적 지식(Knowledge) 도메인을 평가하기 위한 과제로, 잉크가 물에 퍼지는 물리적 현상을 모델이 정확히 예측할 수 있는지 시험한다.
도형 크기 패턴 완성 과제의 시작 프레임으로 일정한 규칙을 가진 오각형 나열을 보여준다.
Screenshot추상화(Abstraction) 능력을 측정하며, 제시된 도형들의 크기 변화 규칙을 파악하여 빈 상자에 올바른 크기의 다음 도형을 생성해야 한다.
평면 왜곡 보정 과제를 위한 그리드와 가이드 라인이 표시된 이미지이다.
Diagram공간성(Spatiality) 도메인 과제로, 파란색 그리드를 붉은색 사각형 윤곽에 맞춰 원근 변환(Perspective Transformation)하는 능력을 평가한다.
03
평가 영역은 지식(Knowledge), 추상화(Abstraction), 공간성(Spatiality), 변환(Transformation), 지각(Perception)의 5개 카테고리로 세분화되어 모델의 다각적인 지능 지수를 분석한다.
04
현재 리더보드 결과에 따르면 VBVR-Wan2.2가 가장 우수한 성능을 보였으나, 모든 최신 모델이 인간의 추론 수준(97.4%)에는 크게 미치지 못하는 한계를 드러냈다.

용어 해설

비디오 추론(Video Reasoning)
비디오 데이터 내에서 객체의 움직임, 물리적 상호작용, 인과 관계를 시공간적으로 이해하고 논리적 결론을 도출하는 능력이다. 단순한 시각적 재현을 넘어 세계의 작동 원리를 파악해야 하므로 차세대 AI 지능의 핵심 지표로 평가받는다.
데이터 엔진(Data Engine)
특정 규칙이나 물리 법칙을 알고리즘으로 구현하여 학습 및 평가에 필요한 데이터를 자동으로 대량 생성하는 시스템이다. 인간이 직접 제작하기 어려운 정교한 물리 시나리오나 논리적 패턴 과제를 일관성 있게 공급할 수 있다.
원근 변환(Perspective Transformation)
3차원 공간의 객체를 특정 시점에서 바라본 2차원 평면으로 투영하거나 그 반대의 과정을 수행하는 기하학적 변환 기법이다. 비디오 모델이 공간의 깊이, 각도, 형태 왜곡을 정확히 인지하고 처리하는지 측정하는 데 사용된다.

기술

  • Wan 2.2
  • Sora 2
  • Veo 3.1
  • Runway Gen-4
  • CogVideoX 1.5

활용 사례

  • 비디오 모델의 시공간 추론 성능 평가
  • 물리 법칙 준수 영상 생성 연구
  • 고차원 지능형 비디오 에이전트 개발

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 25.수집 2026. 03. 06.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.