본문으로 건너뛰기

Holi-Spatial: 비디오 스트림을 통합적 3D 공간 지능으로 진화시키기

기존 3D 데이터셋은 사람이 일일이 라벨링해야 하는 한계로 인해 규모 확장이 매우 어려웠다. 이 논문은 일반 비디오를 고품질 3D 장면과 질문-답변 쌍으로 변환하는 완전 자동화 파이프라인을 제시하여, 데이터 부족 문제를 해결하고 모델의 공간 추론 능력을 비약적으로 향상시켰다.

용어 해설

3D 가우시안 스플래팅(3D Gaussian Splatting)
3D 공간을 수많은 반투명한 타원체(Gaussian)들의 집합으로 표현하여 실시간으로 고화질 영상을 렌더링하는 기술이다. 여러 각도에서 촬영된 2D 이미지를 입력받아 공간의 기하학적 구조와 색상 정보를 학습하며, 기존 방식보다 훨씬 빠르고 정교한 복원이 가능하다.
역투영(Back-projection)
2D 이미지 평면상의 픽셀 좌표를 깊이(Depth) 정보와 카메라 파라미터를 이용해 3차원 공간 좌표로 변환하는 과정이다. 2D에서 탐지된 물체의 마스크를 3D 공간상의 점구름(Point Cloud)으로 들어올려 입체적인 위치를 파악하는 데 필수적인 단계이다.
지향성 경계 상자(Oriented Bounding Box)
물체를 감싸는 직육면체 상자를 만들 때, 축에 고정되지 않고 물체의 실제 회전 방향에 맞춰 기울어지게 설정한 경계 상자이다. 일반적인 상자보다 물체의 크기와 방향을 훨씬 정밀하게 나타낼 수 있어 3D 공간 이해에서 중요하다.
개방형 어휘(Open-vocabulary)
모델이 학습 과정에서 미리 정의된 특정 카테고리 목록에 갇히지 않고, 자연어 설명을 통해 처음 보는 물체나 개념도 인식하고 분류할 수 있는 능력이다. 이는 AI가 현실 세계의 수만 가지 다양한 물체를 유연하게 이해하도록 돕는다.
3D 접지(3D Grounding)
"창문 옆에 있는 파란색 소파"와 같은 자연어 설명이 주어졌을 때, 3D 공간 내에서 해당 설명에 부합하는 정확한 물체의 위치와 범위를 찾아내는 기술이다. 언어와 3D 시각 정보를 연결하는 핵심적인 공간 지능 작업이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 08.수집 2026. 03. 11.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.