본문으로 건너뛰기
HF Daily Papers조회 1

생각하고, 행동하고, 구축하라: 제로샷 3D 비주얼 그라운딩을 위한 비전 언어 모델 기반 에이전트 프레임워크

기존 3D 객체 탐지는 미리 가공된 3D 점군 데이터가 필수적이었으나, 이 논문은 일반 RGB-D 영상 스트림만으로 실시간 3D 재구성과 탐지를 동시에 수행하는 에이전트 방식을 제시한다. 이는 로봇이 낯선 환경에서 별도의 3D 지도 없이도 자연어 명령만으로 물체를 찾아낼 수 있는 가능성을 열어준다.

용어 해설

3D 비주얼 그라운딩(3D Visual Grounding)
자연어 설명을 기반으로 3D 장면 내에서 특정 물체의 위치를 정확히 찾아내는 기술이다. 텍스트의 의미적 이해와 3D 공간의 기하학적 구조를 결합해야 하므로 로봇 공학 및 증강 현실 분야에서 핵심적인 역할을 한다.
제로샷 학습(Zero-Shot Learning)
모델이 학습 과정에서 한 번도 본 적 없는 범주나 데이터에 대해 추가적인 학습 없이 추론을 수행하는 기법이다. 사전 학습된 거대 모델의 범용 지식을 활용하여 새로운 환경이나 물체에 즉각 대응할 수 있게 한다.
RGB-D 스트림(RGB-D)
일반적인 컬러 이미지(RGB)에 각 픽셀의 거리 정보인 깊이(Depth) 데이터가 결합된 영상 데이터 형식이다. 2D 이미지의 시각 정보와 3D 공간의 거리 정보를 동시에 제공하여 정밀한 3D 재구성을 가능하게 한다.
다중 뷰 기하학(Multi-view Geometry)
서로 다른 위치에서 촬영된 여러 장의 2D 이미지들 사이의 기하학적 관계를 이용하여 3D 구조를 복원하는 수학적 원리이다. 카메라의 위치와 각도 파라미터를 통해 2D 픽셀을 3D 좌표로 변환하는 핵심 기반이 된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 01.수집 2026. 04. 03.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.