본문으로 건너뛰기

AnyGroundBench: 비전-언어 모델의 시공간 비디오 그라운딩을 위한 전문 도메인 벤치마크

일반 도메인에서 우수한 성능을 보이는 VLM도 전문 분야의 희소한 시각 개념과 복잡한 시공간 역학에서는 실패하는 경향이 있다. AnyGroundBench는 수술, 산업, 동물행동 등 다섯 개 전문 도메인에서 학습용 소량 데이터를 제공해 적응 능력을 정량적으로 측정하는 구조를 갖추었다. 이로써 실제 배포 환경에서 요구되는 '사전학습만으로는 해결할 수 없는 적응 능력'을 평가 가능한 지표로 만들었다.

추가 이미지 분석

Figure 4는 데모 수 변화(0–4)에 따른 STVG, TVG, SVG 성능 변화를 시각화한 히스토그램/라인 차트이다.
Chart

이 그림은 데모 수 증가가 주로 TVG에 긍정적 영향을 주는 반면 SVG 점수는 데모 수가 늘어날수록 감소하는 경향을 수치적으로 보여준다. 결과 해석에서 단순한 ICL 데모 확장이 공간적 로컬라이제이션 문제를 해결하지 못한다는 실험적 근거를 제공한다.

Figure 4는 데모 수 변화(0–4)에 따른 STVG, TVG, SVG 성능 변화를 시각화한 히스토그램/라인 차트이다.

Figure 5는 시간 길이와 박스 크기별로 STVG/TVG/SVG 성능의 민감도를 분석한 그래프이다.
Chart

그래프는 짧은 이벤트(<1s)에서 TVG·STVG 성능이 크게 저하되고 작은 박스에서는 SVG가 현저히 낮아짐을 보여준다. 이 결과는 짧은 시간 범위와 작은 객체가 전문 도메인에서 주요 실패 요인이라는 정량적 증거를 제공한다.

Figure 5는 시간 길이와 박스 크기별로 STVG/TVG/SVG 성능의 민감도를 분석한 그래프이다.

용어 해설

시공간 비디오 그라운딩(Spatio-Temporal Video Grounding)
영상과 자연어 질의를 입력으로 받아 대상 객체의 시간적 구간과 프레임별 공간 바운딩 박스를 동시에 예측하는 과업으로, 이 논문에서는 STVG를 전체 과제로 규정하고 SVG와 TVG로 분해하여 분석한다. 입력으로 비디오 프레임 시퀀스와 텍스트 질의가 주어지면 모델은 시간적 경계와 각 프레임의 박스를 반환한다. 작은 객체와 짧은 이벤트가 높은 난이도를 유발하는 주요 요인으로 다루어진다.
공간 비디오 그라운딩(Spatial Video Grounding (SVG))
주어진 정답 시간 구간 내에서 각 프레임에 대해 대상 객체의 바운딩 박스를 예측하는 하위 과제로, 시간 경계 추정의 영향을 배제해 공간적 정확도를 독립적으로 측정한다. 논문은 SVG 성능 저하가 전체 STVG 붕괴의 주요 원인임을 보여주었다. SVG 평가는 sIoU 기준으로 수행된다.
시간 비디오 그라운딩(Temporal Video Grounding (TVG))
비디오와 질의를 입력으로 받아 질의에 대응하는 이벤트의 시작과 끝 시간만을 예측하는 하위 과제로, 시간 경계 검출 능력을 정량화한다. 논문은 TVG가 SVG보다 상대적으로 더 잘 작동할 수 있음을 실험적으로 확인하였다. TVG 평가는 tIoU 기준으로 수행된다.
비디오 IoU (vIoU)(vIoU)
예측된 시공간 튜브와 정답 튜브의 교집합을 합집합으로 나눈 비율로 STVG 전체 성능을 측정한다. [email protected] 등 임계값 기반 지표가 논문에서 주된 평가 척도로 사용되었다. 작은 박스와 짧은 세그먼트에서는 vIoU가 급격히 낮아지는 경향이 관찰되었다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 02.수집 2026. 07. 04.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.