섹션별 상세
기존 VLM은 시점 변화에 따라 동일 객체에 대해 일관되지 않은 묘사를 내놓아 에이전트의 의미론적 표현 구축을 방해했다. 데이터 연관성, 캡셔닝, 탐사 정책을 하나의 자기회귀 프레임워크로 통합하는 구조를 채택했다. 객체별 토큰으로 직렬화된 메모리는 시점이 바뀌어도 객체의 정체성을 유지하며 일관된 설명을 생성하는 근거가 된다. 복잡한 다단계 파이프라인 없이도 장기적인 의미론적 일관성을 확보하는 것이 가능하다.
모델은 현재 시각 정보와 함께 탐사된 지형 정보 및 과거 객체 정보를 담은 에피소드 메모리를 입력으로 받는다. 에피소드 메모리는 객체 단위의 토큰으로 변환되어 모델이 과거에 관찰한 객체와 현재 객체를 대조하고 추론하는 핵심 요소로 작용한다. 이러한 구조는 에이전트가 환경을 이동하며 수집한 정보를 누적하여 더 정확하고 일관된 캡션을 생성하도록 돕는다. 결과적으로 에이전트는 단순히 현재 보이는 것뿐만 아니라 과거의 기억을 바탕으로 객체를 인식한다.
학습을 위해 사실적인 3D 환경에서 불일치 기반 정책과 의사 캡셔닝 모델을 사용해 자체 지도 학습 데이터셋을 구축했다. 다중 시점 캡션 이력 간의 일관성을 강제하는 의사 캡셔닝 기법을 통해 모델이 스스로 일관성을 학습하도록 유도했다. 수동으로 주석이 달린 테스트 세트 평가에서 표준 캡셔닝 점수가 11.86% 상승하는 성과를 거두었다. 대규모 수동 라벨링 없이도 고품질의 일관된 캡셔닝 모델을 학습시킬 수 있는 가능성이 확인됐다.
용어 해설
- 비전-언어 모델(Vision-Language Model)
- — 이미지와 텍스트를 동시에 이해하고 처리하여 이미지에 대한 설명을 생성하거나 질문에 답하는 인공지능 모델이다. 시각적 특징을 언어적 표현으로 변환하는 능력이 핵심이며 멀티모달 학습의 중심 기술이다.
- 자기회귀 프레임워크(Autoregressive Framework)
- — 이전 단계의 출력을 다음 단계의 입력으로 사용하여 순차적으로 데이터를 생성하거나 예측하는 구조이다. 자연어 처리에서 문장을 생성할 때 앞서 나온 단어들을 바탕으로 다음 단어를 예측하는 방식이 대표적이다.
- 데이터 연관성(Data Association)
- — 서로 다른 시점이나 시간대에서 관찰된 데이터가 동일한 객체에서 온 것인지 식별하고 연결하는 기술이다. 자율 주행이나 로봇 공학에서 여러 센서 데이터를 통합해 객체의 궤적을 추적하는 데 필수적이다.
- 에피소드 메모리(Episodic Memory)
- — 에이전트가 과거에 경험한 특정 사건이나 관찰 내용을 저장하고 필요할 때 다시 꺼내어 활용하는 기억 시스템이다. 현재 상황을 판단할 때 과거의 맥락을 참조할 수 있게 하여 장기적인 일관성을 유지하게 돕는다.
- 자체 지도 학습(Self-supervised Learning)
- — 사람이 직접 라벨을 달아주지 않고 데이터 자체에서 정답(라벨)을 생성하여 모델을 학습시키는 방법이다. 방대한 양의 데이터를 저비용으로 학습에 활용할 수 있어 최신 AI 연구의 핵심 트렌드이다.
기술
- VLM
- RGB observation
- Top-down map
활용 사례
- 자율 주행 로봇의 객체 인식
- 가사 도우미 로봇의 의미론적 지도 구축
- 다중 시점 보안 카메라 영상 분석
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 30.수집 2026. 04. 04.출처 타입 PAPER
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.