본문으로 건너뛰기
HF Daily Papers조회 1

시청하며 생각하기: 멀티모달 대형 언어 모델의 멀티턴 비디오 추론을 위한 온라인 스트리밍 세그먼트 수준 메모리

기존 비디오 AI는 영상을 다 본 뒤에야 답하거나 답하는 동안 영상을 보지 못하는 한계가 있었다. 이 논문은 영상을 보면서 동시에 메모리를 작성하고 생각하는 구조를 도입해 실시간 대화의 끊김을 없애고 장기 기억력을 획기적으로 높였다.

용어 해설

메모리 침식(Memory Erosion)
멀티턴 대화가 진행됨에 따라 이전 질문이나 시각적 단서에 대한 기억이 점차 희미해지는 현상이다. 스트리밍 환경에서 새로운 입력이 계속 들어오고 답변 생성이 반복되면서 과거의 중요한 정보를 덮어쓰거나 잊게 되어 장기 의존성 모델링을 방해한다.
직렬화 병목(Serialization Bottleneck)
모델이 답변을 생성(디코딩)하는 동안 새로운 영상 데이터의 입력을 중단해야 하는 구조적 한계다. 입출력이 순차적으로만 처리되어 실시간 스트리밍 영상의 흐름을 따라가지 못하고 지연 시간이 누적되는 원인이 된다.
멀티모달 회전 위치 임베딩(MRoPE)
텍스트와 이미지 등 서로 다른 모달리티의 토큰에 회전 기반의 위치 정보를 부여하는 기법이다. 시간, 높이, 너비 등 다차원 축에 대해 위치를 할당하여 모델이 멀티모달 데이터의 구조적 관계를 더 잘 이해하도록 돕는다.
이중 KV 캐시(Dual KV Cache)
영상 입력을 처리하는 캐시와 텍스트 답변을 생성하는 캐시를 분리하여 관리하는 기술이다. 이를 통해 영상 수신과 답변 생성을 동시에 병렬로 수행할 수 있어 스트리밍 환경에서의 실시간성을 보장한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 12.수집 2026. 03. 17.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.