본문으로 건너뛰기

Self-in-Space: UAV 체화 지능에서 자기 인식과 공간 인지를 평가하는 벤치마크

SIS-Bench는 1,646개 UAV 영상에서 수집한 4,856개 QA로 MLLM의 공간 인지와 자기 인식을 perception-memory-reasoning 계층으로 평가하고, 광류 기반 모션 융합이 인지·기억 성능을 개선함을 보였다.

용어 해설

광류(Optical Flow)(Optical Flow)
연속된 영상 프레임 사이의 픽셀 이동 벡터 필드를 의미한다. 본문에서는 RAFT, Sea-RAFT, MemFlow, MOFNet 같은 추정기를 통해 프레임 간 움직임을 계산하고 이를 3채널 의사 이미지(노름, x성분, y성분)로 변환하여 모션 인코더에 입력한다. 움직임 신호는 UAV의 자기 상태와 시야 변화 정보를 명시적으로 제공하는 핵심 단서로 활용된다.
모션 인코더(Motion Encoder)
광류로부터 생성한 시간축의 의사 이미지 시퀀스를 입력받아 모션 토큰을 출력하는 ViT 기반 인코더를 의미한다. 이 인코더는 방향성, 속도 변화, 관측자(viewpoint) 이동 정보를 포착한 토큰을 생성하여 시각적 외형 토큰과 정렬 및 결합된다. 결합된 표현은 자기 상태와 공간 문맥을 동시에 반영하는 데 사용된다.
연결 영상(Concatenated Video)(Concatenated Video)
서로 다른 짧은 Single Video 클립 2~4개를 시간 순으로 이어붙여 메모리 수준의 문맥 의존성을 부여한 입력 형식이다. 이 구성은 연속 구간 간의 정보 보존과 순서 회복 능력을 평가하는 데 사용되어 Landmark Order, Action Sequence 같은 과제를 생성한다. 데이터 파이프라인에서 다양한 소스 클립을 합쳐 장기 의존성 샘플을 만든다.
자기-공간(Self-in-Space)(Self-in-Space)
에이전트의 내부 상태(self)와 외부 환경(space)를 통합해 평가하는 개념적 프레임워크로, 시간에 따른 자기 상태 추적과 공간적 인지 역량을 동시에 측정한다. 본 논문에서는 perception, memory, reasoning의 세 인지 수준으로 구분해 공간 인지와 자기 인식을 병렬로 평가하는 벤치 설계를 의미한다. 이 관점은 UAV의 관측 변화와 행동 이력을 모델링하는 필요성을 부각시킨다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 14.수집 2026. 07. 17.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.