본문으로 건너뛰기

Vinci2: 연속 일인칭 비디오에서의 사전 대응형 지원과 기억 기반 에이전트

EgoServe 벤치마크와 훈련 불필요 메모리 에이전트 EgoMemo를 통해 연속 일인칭 비디오에서 언제 개입할지 스스로 결정하는 사전 대응형 지원 가능성이 실험적으로 확인되었다.

용어 해설

검색 증강 추론(Retrieval-Augmented Reasoning)
질문이나 현재 관찰에 대해 관련 과거 단서들을 색인에서 검색하여 그 결과를 통합한 후 최종 판단을 내리는 방식으로, 본문에서는 다중 스케일의 텍스트·그래프·시각 임베딩을 병렬로 검색해 재구성한 문맥을 LLM에 입력해 개입 여부를 결정하는 데 사용된다.
다중 스케일 시계열 메모리(Multi-Scale Temporal Memory)
클립 수준의 촘촘한 캡션부터 활동 수준의 요약, 세션 수준의 장기 요약으로 계층화된 메모리 구조로, 각 계층을 임베딩해 적절한 시점·범위의 문맥을 효율적으로 검색하는 역할을 한다.
진화형 지식 그래프(Evolving Knowledge Graph)
비디오 캡션으로부터 추출한 엔티티와 관계를 이름 기반 병합으로 누적시켜 노드가 소스 캡션을 참조하도록 유지하는 구조화된 인덱스이며, 의미 기반 검색과 1-hop 확장을 통해 표현 차이를 극복한다.
시각 임베딩 보관소(Visual Embedding Archive)
샘플링한 키프레임을 멀티모달 인코더로 임베딩해 타임스탬프와 캡션 인덱스와 함께 저장하는 아카이브로, 텍스트로 잘 기술되지 않는 외형·구성 정보를 유사도 검색으로 회수하는 데 사용된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 13.수집 2026. 07. 17.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.