본문으로 건너뛰기

GST-Bench: 비디오 기반 글로벌 공간 인식 벤치

장기 에고센트릭 비디오와 탑다운 지도를 결합해 VLM의 전역 공간 추론 능력을 정밀 평가하는 비디오 VQA 벤치입니다.

왜 중요한가

현실 세계에서 작동하는 로봇·에이전트는 에고센트릭 관찰을 시간에 걸쳐 통합하고 보이지 않는 대상을 전역 좌표계로 매핑하는 능력이 필요합니다. 기존 벤치마크는 보통 단일 프레임이나 소수 뷰에 초점을 맞춰 장기적 교차-뷰 통합 능력을 충분히 검증하지 못했습니다. GST-Bench는 길게 이어지는 탐색 비디오, 오프-트랙 쿼리 뷰, 탑다운 지도를 결합해 모델이 실제로 전역 공간 표현을 구축하는지를 정량적으로 평가하도록 설계되어 연구자와 개발자가 해당 약점을 직접 겨냥해 개선할 수 있게 만듭니다.

관련 Figure

논문 소개 그림으로 GST-Bench의 핵심 과제(자기 위치, 객체 위치, 장면 구조 이해)와 입력 형태(탑다운 이미지, 탐색 비디오, 마크된 객체 비디오)를 한 장에 요약한 인포그래픽입니다.
Infographic

이 그림은 쿼리 뷰가 탐색 궤적 밖에서 샘플되고 대상이 쿼리에서 보이지 않도록 설계되었음을 시각적으로 전달합니다. 탑다운-에고센트릭 정합 문제를 직관적으로 보여주며, 모델 성능 차이를 가시화한 막대그래프를 통해 인간 대비 모델 격차(예: Gemini-3-Pro 42.68 vs 인간 79.08)를 강조합니다.

논문 소개 그림으로 GST-Bench의 핵심 과제(자기 위치, 객체 위치, 장면 구조 이해)와 입력 형태(탑다운 이미지, 탐색 비디오, 마크된 객체 비디오)를 한 장에 요약한 인포그래픽입니다.

핵심 기여

비디오 기반 글로벌 공간 인식 벤치마크 구축

GST-Bench는 장기 에고센트릭 탐색 비디오와 오프-트랙 쿼리뷰, 탑다운 지도를 결합해 전역 공간 추론을 시험하는 데이터셋입니다. 데이터 생성은 시뮬레이션에서 기하학적으로 정답을 계산하고 자동 필터링 뒤 인간 검증을 거쳐 2,762개의 검증 샘플을 최종 확보합니다. 이로써 단일 프레임으로 풀 수 없는 교차-뷰 추론만을 엄격히 평가합니다.

12개 세부 과제로 구성된 과제 분류

세 가지 핵심 역량(자기 위치, 객체 위치, 장면 구조 이해)을 12개 세부 과제로 구체화해 다양한 정량적 형식을 도입합니다. 각 과제는 거리·각도·포인트 예측 또는 다지선다 문제로 정의되어 정밀한 수치 기반 평가가 가능합니다. 탑다운 수준은 세 단계로 나뉘어 전역 정보의 가용성에 따른 성능 변화를 관찰할 수 있습니다.

광범위한 모델 평가와 제약 진단

22개 최첨단 VLM을 제로샷으로 평가해 최고 모델도 인간(79.08)에 크게 못 미치는 42.68에 머무르는 등 큰 성능 격차를 확인했습니다. 통제된 로컬 변형 실험을 통해 상용 모델은 국소 인식은 가능한 반면 교차-프레임 통합에서 실패한다는 결론을 도출했습니다. 반면 오픈소스 모델은 국소 인식과 통합 모두에서 취약한 것으로 판별되었습니다.

GST-Train으로의 타깃 지도학습 효과 검증

동일한 파이프라인으로 수집한 학습용 GST-Train을 이용해 Qwen3-VL-8B를 파인튜닝한 결과 평균 점수가 25.89에서 53.52로 27.63 포인트 상승했습니다. 학습 데이터로 전역 공간 추론 능력을 직접 감독하면 격차를 크게 줄일 수 있음을 실험적으로 확인했습니다. 다만 인간 성능과는 여전히 차이가 남아 추가 연구 여지가 남습니다.

핵심 아이디어 이해하기

에고센트릭 시퀀스만으로는 장면 전체의 전역 구조와 보이지 않는 대상의 위치를 일관되게 복원하기 어렵기 때문에, 모델은 긴 비디오 스트림을 통해 국소 관찰을 누적하고 이를 탑다운 좌표계로 정렬하는 능력이 필요합니다. GST-Bench는 쿼리 뷰를 탐색 궤적 밖에서 샘플링하고 대상이 쿼리에서 보이지 않도록 강제해 단일 프레임 해법을 차단합니다. 따라서 평가 결과는 단순한 물체 인식 성능이 아니라 입력 비디오를 어떻게 통합해 전역 지도와 정합시키는지를 직접적으로 측정합니다.

방법론

데이터 생성 파이프라인은 OmniGibson 기반 시뮬레이션 위에서 BEHAVIOR-1K·HyperSim·ArtVIP 등 에셋을 활용해 다수의 장면에서 탐색 궤적과 추가 궤적을 렌더링합니다. 파이프라인은 탐색 비디오, 객체 주석 비디오(대상 등장 프레임에 빨간 박스 오버레이), 오프-트랙 쿼리 뷰, 세 수준 탑다운 이미지를 생성하고 기하학적 정보를 통해 거리·각도·포인트 정답을 자동 계산합니다. 자동 필터링으로 불완전·모호 샘플을 제거한 뒤 인간 검증자가 대상 식별 가능성 및 쿼리뷰의 로컬라이즈 가능성을 확인해 최종 2,762개의 평가 샘플을 확보합니다.

관련 Figure

12개 세부 과제의 대표 샘플을 시각적으로 정리한 도표로, 난이도에 따른 탑다운 선택과 자기·객체 로컬라이제이션의 여러 변형을 포함합니다.
Diagram

각 과제 입력(탐색 비디오, 객체 주석, 탑다운 수준, 쿼리 뷰)과 기대 출력(각도, 포인트, 거리, 선택지)이 한눈에 들어오도록 배열되어 있습니다. 이 도판은 데이터 생성 규칙(대상 비가시성, 오프-트랙 쿼리)을 과제 수준에서 어떻게 강제하는지 명확히 보여줍니다.

12개 세부 과제의 대표 샘플을 시각적으로 정리한 도표로, 난이도에 따른 탑다운 선택과 자기·객체 로컬라이제이션의 여러 변형을 포함합니다.

데이터 수집 및 품질 관리 파이프라인을 도식화한 그림으로, 장면 샘플링→비디오·탑다운 렌더→자동 필터링→인간 검증 흐름이 포함됩니다.
Diagram

파이프라인은 시뮬레이션 기반 자동화로 정답을 기하학적으로 계산한 뒤 자동 필터링으로 잡음을 제거하고 인간 검증으로 최종 품질을 확보하는 구조임을 보여줍니다. 이 과정 덕분에 대규모이면서도 검증된 QA 쌍을 생성할 수 있다는 점이 시각적으로 드러납니다.

데이터 수집 및 품질 관리 파이프라인을 도식화한 그림으로, 장면 샘플링→비디오·탑다운 렌더→자동 필터링→인간 검증 흐름이 포함됩니다.

주요 결과

22개 VLM을 제로샷으로 평가한 결과 전반적 난이도가 높아 최고 모델인 Gemini-3-Pro의 평균 점수는 42.68에 불과했고 인간 평균은 79.08로 큰 격차가 관찰되었습니다. 오픈소스 상위 모델들도 대부분 20~30점 대에 머물렀고 무작위 추측(약 20.01)과 근접한 모델이 다수였습니다. 통제 실험에서 상용 모델은 로컬 보기가 허용되면 점수가 대폭 상승해 실패 원인이 교차-프레임 통합임을 시사했고, Qwen3-VL-8B를 GST-Train으로 파인튜닝하면 25.89→53.52로 27.63포인트 개선되어 지도학습의 유효성이 입증되었습니다.

관련 Figure

통제 실험 결과를 보여주는 차트로, 글로벌 설정과 로컬 변형(Local-Video, Local-Image)에서 모델 성능 변화를 비교합니다.
Chart

이 도표는 상용 모델이 로컬 정보를 제공하면 큰 폭으로 향상되는 반면 오픈소스 모델은 일관되게 개선되지 않는 패턴을 시각적으로 요약합니다. 이를 통해 실패 원인이 국소 인식 부족인지 교차-프레임 통합 실패인지 구분하는 근거가 됩니다.

통제 실험 결과를 보여주는 차트로, 글로벌 설정과 로컬 변형(Local-Video, Local-Image)에서 모델 성능 변화를 비교합니다.

기술 상세

거리 예측 평가는 Mean Relative Accuracy(MRA)를 사용하며 수식은 MRA=1CdθCd\mathbbm1(y^yy<1θ)\mathcal{MRA}=\frac{1}{|\mathcal{C}_d|}\sum_{\theta\in\mathcal{C}_d}\mathbbm{1}\left(\frac{|\hat{y}-y|}{y}<1-\theta\right)입니다. 여기서 y^\hat{y}는 모델 예측 거리, yy는 정답 거리, Cd\mathcal{C}_d는 임계값 집합(0.50~0.95)이며 입력은 예측→상대오차 계산→임계비교→임계별 지표 평균의 순서로 처리됩니다. 각도 평가는 원형 거리 ea=min(α^α,360α^α)e_a=\min(|\hat{\alpha}-\alpha|,360^{\circ}-|\hat{\alpha}-\alpha|)를 구한 뒤 허용 오차 집합 {15,30,45}\{15^{\circ},30^{\circ},45^{\circ}\}에 대한 평균 정확도로 계산하고, 포인트 평가는 픽셀 유클리드 거리 기준 임계값 집합(100,150,200,250,300)에서 평균 정확도를 산출합니다. 최종 점수는 12개 소과제 점수의 산술평균으로 집계됩니다.

한계점

GST-Bench는 시뮬레이션 기반으로 대규모 자동 생성과 정밀한 기하학적 정답 산출이 가능하지만, 합성 렌더링과 실제 센서 관측 간 도메인 차이가 존재할 수 있습니다. 저자들은 평가·학습 분할에서 장면 누수를 방지했으나 시뮬레이션-실세계 일반화 문제는 여전히 남아 있습니다. 또한 GST-Train으로 성능을 크게 향상시킬 수 있으나 인간 수준의 전역 통합 능력까지 완전히 회복되지는 않아 추가적인 모델 아키텍처·학습 전략 연구가 필요합니다.

실무 활용

GST-Bench는 에이전트의 전역 공간 추론 능력을 진단하는 데 바로 사용할 수 있는 평가셋이고, GST-Train은 동일 파이프라인으로 수집된 학습 데이터입니다. 이 두 자원은 전역 좌표 정렬과 장기 메모리 통합을 강화하려는 모델의 개발·평가 루프에 통합될 수 있습니다. 저자들이 제공한 프로젝트 페이지에서 데이터 접근과 파이프라인 정보를 확인할 수 있습니다.

  • 비전-언어 모델의 전역 공간 추론 성능을 정량적으로 평가하는 벤치마크로 활용
  • GST-Train으로 대상 모델을 파인튜닝해 교차-뷰 통합 능력을 개선하는 감독 데이터로 사용
  • 탑다운 지도 정합성, 각도·거리 추정과 같은 특정 소능력(ablation) 진단용 데이터셋으로 활용

코드 공개 여부: 공개

코드 저장소 보기

키워드

비전-언어 모델 VLM에고센트릭 비디오탑다운 이미지글로벌 공간 추론OmniGibsonBEHAVIOR-1KMean Relative Accuracy

용어 해설

에고센트릭 비디오(Egocentric Video)
에고센트릭 비디오는 에이전트 시점에서 촬영된 연속 영상으로, 장기적 관찰을 통해 장면 전체의 공간 정보를 누적할 수 있는 입력입니다. 본 논문에서는 탐색 경로를 따라 렌더된 긴 트래버설 비디오가 주요 증거로 사용됩니다. 이 입력이 있어야만 대상 객체가 현재 뷰에 보이지 않을 때도 과거 관찰을 종합해 위치를 추론할 수 있습니다.
탑다운 이미지(Top-Down Image)
탑다운 이미지는 장면의 전역 지도를 시각화한 것으로, 본 연구는 세 수준(photoreal, occupancy, floor-plan)의 추상화를 사용합니다. 각 수준은 객체 외형·발자국·벽 구조 중 서로 다른 정보를 보존하여 모델의 전역 정렬 능력을 단계적으로 평가합니다. 탑다운 이미지는 에고센트릭 관찰을 전역 좌표계로 투사해 정답을 계산하는 데 직접적으로 활용됩니다.
OmniGibson 시뮬레이션(OmniGibson)
OmniGibson은 물리 기반 실내 시뮬레이션 플랫폼으로, 본 파이프라인에서 다양한 실내 장면과 카메라 궤적을 대규모로 렌더링하는 데 사용됩니다. 시뮬레이션은 객체와 카메라의 3D 좌표를 직접 제공하므로 거리·각도·탑다운 투영을 정확하게 계산할 수 있습니다. 이 특성 덕분에 자동화 생성과 정량적 정답 산출이 가능해집니다.
평균 상대 정확도(MRA)(Mean Relative Accuracy (MRA))
MRA는 거리 예측 평가를 위한 지표로 다양한 신뢰 임계값에 대해 상대오차가 임계값보다 작은지를 평균해 산출합니다. 입력 예측값과 정답 거리를 비교해 상대오차(|ŷ−y|/y)를 계산하고 임계값 집합에서 지표 합산을 통해 결과를 얻습니다. 본 논문은 VSI-Bench 프로토콜을 따라 MRA를 도입해 거리 추정의 정밀도를 평가합니다.
BEHAVIOR-1K 에셋(BEHAVIOR-1K)
BEHAVIOR-1K는 다양한 실내 레이아웃과 객체 배치를 포함한 시뮬레이션 자산 집합으로, 본 데이터 생성에 주요 장면 소스로 활용됩니다. 논문에서는 BEHAVIOR-1K를 포함해 HyperSim·ArtVIP 등 복수 자산을 합쳐 다양성을 확보합니다. 평가와 학습 분할은 장면 단위로 분리해 장면 누수를 방지합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 06.수집 2026. 08. 08.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.