본문으로 건너뛰기

UrbanGround: 복잡한 도시 환경에서 MLLM 에이전트의 공간 추론과 내비게이션을 평가하는 샌드박스.

UrbanGround는 홍콩의 3D 지리 데이터를 기반으로 MLLM 에이전트의 장기적 공간 추론, 내비게이션, 보행자 대응 능력을 평가하는 최초의 도시 시뮬레이션 샌드박스이다.

용어 해설

멀티모달 대형 언어 모델(MLLM)
텍스트와 이미지 등 다양한 모달리티를 동시에 처리하고 이해하는 대형 언어 모델이다. 도시 환경에서 시각적 정보를 해석하고 공간적 맥락을 파악하는 데 사용된다. 에이전트의 지능적 행동을 위한 핵심 기반 기술이다.
공간 접지(Spatial Grounding)
언어적 표현이나 추상적 개념을 실제 3D 공간 내의 특정 위치나 객체와 연결하는 과정이다. 에이전트가 환경을 이해하고 내비게이션을 수행하는 데 필수적이다. 이 논문에서는 에이전트가 관찰한 장면을 공간적 맥락으로 변환하는 능력을 평가하는 지표로 사용된다.
폐루프 상호작용(Closed-loop Interaction)
에이전트가 환경을 관찰하고 행동을 취한 뒤, 그 결과가 다시 관찰 정보로 피드백되는 상호작용 방식이다. 연속적인 의사결정이 필요한 내비게이션에서 중요하다. UrbanGround는 에이전트가 1인칭 시점으로 환경과 상호작용하며 경로를 탐색하는 환경을 제공한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 27.수집 2026. 08. 29.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.