TL;DR
일반 도메인에서 우수한 성능을 보이는 VLM도 전문 분야의 희소한 시각 개념과 복잡한 시공간 역학에서는 실패하는 경향이 있다. AnyGroundBench는 수술, 산업, 동물행동 등 다섯 개 전문 도메인에서 학습용 소량 데이터를 제공해 적응 능력을 정량적으로 측정하는 구조를 갖추었다. 이로써 실제 배포 환경에서 요구되는 '사전학습만으로는 해결할 수 없는 적응 능력'을 평가 가능한 지표로 만들었다.
왜 중요한가
일반 도메인에서 우수한 성능을 보이는 VLM도 전문 분야의 희소한 시각 개념과 복잡한 시공간 역학에서는 실패하는 경향이 있다. AnyGroundBench는 수술, 산업, 동물행동 등 다섯 개 전문 도메인에서 학습용 소량 데이터를 제공해 적응 능력을 정량적으로 측정하는 구조를 갖추었다. 이로써 실제 배포 환경에서 요구되는 '사전학습만으로는 해결할 수 없는 적응 능력'을 평가 가능한 지표로 만들었다.
핵심 기여
전문 도메인 기반 STVG 벤치마크 AnyGroundBench 구축
AnyGroundBench는 animal, industry, sports, surgery, public security의 다섯 전문 도메인을 포함해 총 2,040개 비디오와 3,522개의 질의-튜브 쌍을 수록했다. 데이터셋은 신규 촬영 샘플과 기존 공개 데이터에 대한 고밀도 시공간 바운딩 박스 주석을 결합해 구성되었다. 각 도메인에 대해 전용 학습 서브셋을 제공해 도메인 적응을 체계적으로 평가하도록 설계되었다.
STVG를 SV G와 TVG로 분해해 실패 원인 정밀 분석
논문은 전체 STVG를 공간 담당 SVG와 시간 담당 TVG로 분해해 평가를 수행했다. 이 분해를 통해 공간적 로컬라이제이션 오류가 전체 성능 붕괴의 주된 병목임이 확인되었다. 분석 결과 TVG는 비교적 달성 가능하지만 SVG가 실무적 임계값(vIoU@0.5 등)에서 크게 취약함이 드러났다.
15개 최신 VLM에 대한 제로샷 및 ICL 적응 평가
연구는 GPT 계열과 Gemini 계열을 포함한 프로프라이어터리 모델과 Qwen, InternVL 등 오픈소스 모델을 합쳐 15개 VLM을 평가했다. 각 모델은 제로샷과 2-shot In-Context Learning 기반 적응 성능을 동일한 시스템 프롬프트로 비교받았다. 실험 결과 대부분의 모델이 전문 도메인에서 실무에 쓸 수준의 STVG 성능을 달성하지 못했고 ICL 효과는 불안정했다.
데이터셋 통계와 민감도 분석을 통한 난이도 규명
AnyGroundBench의 평균 비디오 길이는 47.13초이고 목표 세그먼트 평균은 7.51초로 전체 길이의 약 16%에 해당한다. 평균 상대 박스 면적은 10.63%로 작은 타깃이 빈번하며 짧은 이벤트와 작은 객체가 성능 저하의 주요 요인으로 확인되었다. 추가 분석에서 데모 수와 검색 전략이 TVG와 SVG에 서로 다른 영향을 미침이 실험적으로 입증되었다.
핵심 아이디어 이해하기
시공간 비디오 그라운딩 문제는 비디오 프레임 시퀀스와 자연어 질의를 받아 시간적 경계와 각 프레임의 바운딩 박스를 동시에 예측하는 과업이다. 기존 벤치마크와 사전학습 중심 평가는 일상적 장면에 편중되어 있어 전문 도메인에서 요구되는 희소한 시각 개념과 정밀한 시공간 역학을 반영하지 못한다. 따라서 '사전학습된 지식만으로 모든 도메인을 포괄할 수 없다'는 현실을 전제로 적응 능력을 별도로 측정할 필요가 있다. AnyGroundBench의 해결 원리는 도메인별로 전용 훈련 샘플을 제공해 적응 성능을 직접 측정하는 것이다. 구체적으로 각 도메인에 대해 소량의 학습 집합을 마련하고 동일한 기본 VLM에 대해 제로샷과 In-Context Learning(데모 기반) 적응을 비교한다. 이렇게 하면 입력 수준(검색된 데모) 기반의 비역치적 적응과 파라미터 업데이트 기반 적응을 동일한 지표로 비교할 수 있다. 이 접근은 두 가지 중요한 통찰을 낳는다. 첫째, 시간 경계 추정(TVG)은 상대적으로 달성 가능하나 공간적 로컬라이제이션(SVG)이 실제 임계값에서 성능을 붕괴시킨다. 둘째, 데모 기반 적응(ICL)은 TVG를 개선하는 경우가 있으나 SVG에는 일관된 개선을 주지 못하고 때로는 악영향을 끼쳐 단순한 추론 시점 적응만으로는 한계가 명확하다. 따라서 전문 도메인 STVG의 핵심은 소량의 샘플로 공간적 추론 능력을 향상시키는 방법론에 있다.
방법론
전체 접근은 세 가지 평가 과제를 동일한 VLM으로 유도하는 단일 시스템 프롬프트 설계에 기반한다. 세 과제는 STVG(시공간 튜브 예측), SVG(정답 시간 구간 내 프레임별 박스 예측), TVG(시간 경계 예측)로 정의되며 각 과제는 pSTVG, pSVG, pTVG라는 프롬프트로 모델에 요구되는 출력을 구분한다. 이 방식으로 동일 모델의 서로 다른 능력(공간 vs 시간)을 별도 지표로 분해해 측정할 수 있다. 적응 프로토콜은 도메인별 훈련 집합을 제공하고 임의의 적응 연산자 𝒜를 허용하는 범용적 설계를 채택했다. 논문은 백프로파게이션이 필요 없는 참조 인스턴스로 m-shot In-Context Learning을 채택해 m=2 데모를 검색해 입력에 조건화하는 절차를 사용했다. 데모 검색은 텍스트 인베딩과 비주얼 인베딩의 코사인 유사도를 가중합해 최상위 예시를 선택하는 방식으로 구현되었으며, 검색 전략(텍스트 전용, 비디오 전용, 텍스트+비디오, 무작위)을 비교 실험했다. 주석 파이프라인은 detection-then-tracking 접근을 사용하고 자동화된 모델(Grounding DINO, SAM2 등)으로 초기 추정 후 사람 검수를 거쳐 고밀도 시공간 박스를 확보했다. 기존 데이터셋의 라벨은 포맷 변환을 통해 통일했고 신규 촬영 샘플에는 도메인 전문가가 참여해 임상의·현장성 기준을 보장했다. 마지막으로 모든 샘플은 두 명 이상의 검수자를 통해 품질 통제를 수행했다.
관련 Figure

이 그림은 AnyGroundBench가 신규 촬영 예시(예: 마우스 긁기, 수술 장면)와 기존 데이터셋을 결합했음을 시각적으로 확인시킨다. 예시 비교는 제로샷, 2-shot ICL 예측과 정답을 병치해 ICL이 일부 샘플에서 시간적 경계를 개선하지만 공간적 로컬라이제이션은 여전히 불안정함을 확인할 수 있게 한다.
Figure 1은 다섯 개 전문 도메인에서의 예시 질의와 정답 튜브 및 예측 결과를 나란히 보여준다.

질의 길이 분포는 대부분 짧은 문장(평균 약 8.5단어)에 몰려 있음을 보여주며, 이는 검색 기반 데모 선택과 텍스트 유사도 계산이 ICL 성능에 민감하게 작용할 가능성을 시사한다. 짧은 질의의 특성은 텍스트 신호만으로는 공간적 상황을 충분히 구별하기 어렵다는 점을 뒷받침한다.
Figure 6는 질의 길이 분포와 ICL/제로샷의 관계를 나타내는 히스토그램으로 질의 길이 평균과 분포를 시각화하고 있다.
주요 결과
데이터셋 통계에서 AnyGroundBench의 평균 비디오 길이는 47.13초이고 목표 세그먼트 평균은 7.51초로 집계되었다. 평균 상대 박스 면적은 10.63%로 나타나 작은 타깃이 빈번하다는 점이 수치로 확인되었다. 이 통계는 시간적·공간적 분해 평가의 난이도를 정량적으로 뒷받침한다. 주요 실험에서 15개의 VLM을 대상으로 제로샷과 2-shot ICL을 비교한 결과 전체 STVG 성능은 모든 도메인에서 낮았고 특히 SVG에서 심각한 취약성이 발견되었다. 일부 대형 프로프라이어터리 모델은 TVG에서 상대적으로 높은 점수를 얻었으나 vIoU@0.3 같은 실용적 지표에서 일관된 성공을 보이지 못했다. ICL은 도메인 및 모델에 따라 TVG 성능을 개선시키는 경우가 있었으나 SVG 성능은 오히려 감소하는 경우가 빈번해 적응 방법으로서의 안정성이 부족함이 확인되었다. 추가 분석에서 데모 수를 0에서 4까지 늘린 실험은 TVG에 주로 이득을 주었고 SVG는 데모 수 증가에 따라 지속적으로 하락하는 경향을 보였다. 검색 전략 비교에서는 텍스트+비디오 결합 검색이 평균적으로 STVG와 TVG에 유리했으나 SVG에서는 무작위 검색이 더 강한 결과를 보인 도메인이 있어 과제별로 최적 검색 신호가 다름이 드러났다. 시간 길이와 박스 크기 민감도 분석은 짧은 이벤트(<1s)와 작은 박스(<2.6%)에서 성능 저하가 가장 심함을 수치로 보여주었다.
관련 Figure

데이터 분포 차트는 훈련 및 테스트 세트가 다섯 도메인에 균등하게 분포되어 있음을 보여준다. 비디오 길이 평균 47.13초, 세그먼트 평균 7.51초, 평균 상대 박스 면적 10.63%라는 수치적 특성이 그래프로 명확히 드러나 벤치마크의 난이도 근거로 작동한다.
Figure 2 (a,b,c...)는 도메인 분포, 비디오 길이, 세그먼트 길이, 질의 길이, 박스 면적 등 데이터셋 통계를 시각화한 일련의 차트이다.

정성 결과는 ICL이 일부 케이스에서 시간적 위치를 개선하나 프레임별 박스 정밀도가 여전히 부족함을 드러낸다. 이 시각적 증거는 테이블상의 수치와 일관되며 공간적 오류가 전체 STVG 성능을 제한함을 보강한다.
Figure 3은 Gemini-3.1-Pro의 정성적 STVG 결과 예시를 도메인별로 제로샷과 2-shot ICL로 비교한 이미지이다.

상대 박스 면적의 히스토그램은 다수 샘플에서 타깃이 영상에서 차지하는 비율이 작아 모델의 공간적 정밀도가 중요한 난제로 남아 있음을 강조한다. 이 통계는 SVG 성능 저하의 근거 자료로 기능한다.
Figure 7는 상대 박스 면적의 분포를 보여주는 히스토그램으로 평균이 약 10.6%임을 표시한다.
기술 상세
전체 아키텍처 관점에서 AnyGroundBench는 데이터 포맷을 통일한 시공간 튜브(프레임별 바운딩 박스 + 시간 간격)와 자연어 질의 쌍을 기준으로 설계되었다. 입력 비디오는 프레임 시퀀스 V와 질의 Q로 표기되며 모델 출력은 τ̂={ (t, b̂t) } 또는 그 파생물인 시간 경계 [t̂s, t̂e] 또는 정답 시간 구간 내 박스 시퀀스로 정의된다. 동일한 ℱθ에 대해 시스템 프롬프트 p를 바꿔 STVG/SVG/TVG를 유도하는 방식이 평가 파이프라인의 핵심 규격이다. 데이터 주석은 detection-then-tracking 흐름을 따르며 초기 박스는 Grounding DINO에 텍스트 질의를 입력해 얻고 SAM2 기반 트래킹 및 수동 교정으로 고밀도의 프레임별 튜브를 생성했다. 이 과정은 자동(첫 프레임에서 자동 추출 후 트래킹), 반자동(수작업 첫 프레임 라벨링 후 트래킹), 수동(프레임별 라벨링)의 세 가지 모드로 이루어졌고 최종적으로 이중 검수로 품질을 확보했다. 적응 프로토콜 수학적 정식화는 다음과 같다. 훈련 서브셋 𝒯Dtrain={(Vj,Qj,τj*)}j=1K와 기본 VLM ℱθ, 그리고 임의의 적응 연산자 𝒜를 받아 적응된 예측기 g=𝒜(ℱθ,𝒯Dtrain)를 생성한다. ICL 인스턴스에서는 g(V,Q)=ℱθ(V,Q|ℰ(V,Q);p)이며 ℰ(V,Q)=ℛ(V,Q;𝒯Dtrain,m)으로 m개의 데모를 검색해 입력에 조건화한다. 검색 함수 ℛ은 텍스트 인베딩(SentenceBERT)과 비디오 인베딩(InternVideo2)의 가중합 코사인 유사도를 사용한다. 평가 지표는 STVG에 대해 vIoU@0.3, TVG에 대해 tIoU@0.3, SVG에 대해 sIoU@0.3을 적용했다. 민감도 분석은 시간 길이(짧음<1s, 중간 1–3s, 김≥3s)와 상대 박스 면적(작음<2.6%, 중간 2.6–10%, 큼>10%)으로 샘플을 분류해 각각의 성능 변화를 측정했다. 추가 메트릭과 임계값별 결과는 부록에 상세 표가 제공되어 있다.
실무 활용
AnyGroundBench는 전문 도메인에서 VLM의 적응 능력을 평가하기 위한 표준화된 데이터 및 프로토콜을 제공해 실제 배포 전 적응성 검증을 가능하게 한다. 연구자와 개발자는 벤치마크의 전용 훈련 서브셋을 사용해 소량 데이터 적응법(예: PEFT, ICL, TTT)을 비교할 수 있다. 공개 GitHub 저장소를 통해 재현과 확장 실험이 가능한 형태로 배포되었다.
- 수술 비디오에서 소량 라벨로 도구나 병변을 시공간적으로 로컬라이즈하는 적응 알고리즘 개발
- 제조·정비용 작업 흐름에서 전문 도구 행동을 식별하기 위한 소량 파인튜닝 워크플로 검증
- 동물 행동 연구에서 고빈도 미세 움직임(예: 마우스 긁기)을 정확히 추적하는 모델 평가
코드 공개 여부: 공개
코드 저장소 보기키워드
추가 이미지 분석

이 그림은 데모 수 증가가 주로 TVG에 긍정적 영향을 주는 반면 SVG 점수는 데모 수가 늘어날수록 감소하는 경향을 수치적으로 보여준다. 결과 해석에서 단순한 ICL 데모 확장이 공간적 로컬라이제이션 문제를 해결하지 못한다는 실험적 근거를 제공한다.
Figure 4는 데모 수 변화(0–4)에 따른 STVG, TVG, SVG 성능 변화를 시각화한 히스토그램/라인 차트이다.

그래프는 짧은 이벤트(<1s)에서 TVG·STVG 성능이 크게 저하되고 작은 박스에서는 SVG가 현저히 낮아짐을 보여준다. 이 결과는 짧은 시간 범위와 작은 객체가 전문 도메인에서 주요 실패 요인이라는 정량적 증거를 제공한다.
Figure 5는 시간 길이와 박스 크기별로 STVG/TVG/SVG 성능의 민감도를 분석한 그래프이다.
용어 해설
- Spatio-Temporal Video Grounding
- — 영상과 자연어 질의를 입력으로 받아 대상 객체의 시간적 구간과 프레임별 공간 바운딩 박스를 동시에 예측하는 과업으로, 이 논문에서는 STVG를 전체 과제로 규정하고 SVG와 TVG로 분해하여 분석한다. 입력으로 비디오 프레임 시퀀스와 텍스트 질의가 주어지면 모델은 시간적 경계와 각 프레임의 박스를 반환한다. 작은 객체와 짧은 이벤트가 높은 난이도를 유발하는 주요 요인으로 다루어진다.
- Spatial Video Grounding (SVG)
- — 주어진 정답 시간 구간 내에서 각 프레임에 대해 대상 객체의 바운딩 박스를 예측하는 하위 과제로, 시간 경계 추정의 영향을 배제해 공간적 정확도를 독립적으로 측정한다. 논문은 SVG 성능 저하가 전체 STVG 붕괴의 주요 원인임을 보여주었다. SVG 평가는 sIoU 기준으로 수행된다.
- Temporal Video Grounding (TVG)
- — 비디오와 질의를 입력으로 받아 질의에 대응하는 이벤트의 시작과 끝 시간만을 예측하는 하위 과제로, 시간 경계 검출 능력을 정량화한다. 논문은 TVG가 SVG보다 상대적으로 더 잘 작동할 수 있음을 실험적으로 확인하였다. TVG 평가는 tIoU 기준으로 수행된다.
- vIoU
- — 예측된 시공간 튜브와 정답 튜브의 교집합을 합집합으로 나눈 비율로 STVG 전체 성능을 측정한다. vIoU@0.3 등 임계값 기반 지표가 논문에서 주된 평가 척도로 사용되었다. 작은 박스와 짧은 세그먼트에서는 vIoU가 급격히 낮아지는 경향이 관찰되었다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.