용어 해설
- 광류(Optical Flow)(Optical Flow)
- — 연속된 영상 프레임 사이의 픽셀 이동 벡터 필드를 의미한다. 본문에서는 RAFT, Sea-RAFT, MemFlow, MOFNet 같은 추정기를 통해 프레임 간 움직임을 계산하고 이를 3채널 의사 이미지(노름, x성분, y성분)로 변환하여 모션 인코더에 입력한다. 움직임 신호는 UAV의 자기 상태와 시야 변화 정보를 명시적으로 제공하는 핵심 단서로 활용된다.
- 모션 인코더(Motion Encoder)
- — 광류로부터 생성한 시간축의 의사 이미지 시퀀스를 입력받아 모션 토큰을 출력하는 ViT 기반 인코더를 의미한다. 이 인코더는 방향성, 속도 변화, 관측자(viewpoint) 이동 정보를 포착한 토큰을 생성하여 시각적 외형 토큰과 정렬 및 결합된다. 결합된 표현은 자기 상태와 공간 문맥을 동시에 반영하는 데 사용된다.
- 연결 영상(Concatenated Video)(Concatenated Video)
- — 서로 다른 짧은 Single Video 클립 2~4개를 시간 순으로 이어붙여 메모리 수준의 문맥 의존성을 부여한 입력 형식이다. 이 구성은 연속 구간 간의 정보 보존과 순서 회복 능력을 평가하는 데 사용되어 Landmark Order, Action Sequence 같은 과제를 생성한다. 데이터 파이프라인에서 다양한 소스 클립을 합쳐 장기 의존성 샘플을 만든다.
- 자기-공간(Self-in-Space)(Self-in-Space)
- — 에이전트의 내부 상태(self)와 외부 환경(space)를 통합해 평가하는 개념적 프레임워크로, 시간에 따른 자기 상태 추적과 공간적 인지 역량을 동시에 측정한다. 본 논문에서는 perception, memory, reasoning의 세 인지 수준으로 구분해 공간 인지와 자기 인식을 병렬로 평가하는 벤치 설계를 의미한다. 이 관점은 UAV의 관측 변화와 행동 이력을 모델링하는 필요성을 부각시킨다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




