본문으로 건너뛰기

Proact-VL: 실시간 AI 컴패니언을 위한 능동형 비디오 LLM

기존 비디오 AI는 질문에만 답하거나 쉴 새 없이 말을 하여 사용자 경험을 해치는 한계가 있었다. 이 논문은 AI가 상황을 인지하고 적절한 순간에만 개입하는 능동성을 부여하여, 게임 해설이나 플레이 가이드와 같은 실시간 상호작용 분야에서 인간과 유사한 동반자를 구현할 수 있는 길을 열었다.

용어 해설

키-값 캐시(KV Cache)
Transformer 모델이 이전 토큰의 연산 결과를 저장해두는 메모리 영역이다. 새로운 토큰을 생성할 때마다 처음부터 다시 계산하지 않고 저장된 값을 재사용하여 추론 속도를 비약적으로 높이는 핵심 기술이다.
능동적 상호작용(Proactive Interaction)
사용자의 명시적인 명령이나 질문이 없어도 AI가 상황을 스스로 판단하여 먼저 말을 걸거나 정보를 제공하는 방식이다. 실시간 환경 인지와 의사결정 정책이 결합되어야 구현 가능하다.
회전식 위치 임베딩(RoPE)
토큰의 상대적 위치 정보를 복소수 회전 행렬을 이용해 인코딩하는 기법이다. 긴 문맥에서도 토큰 간의 거리를 효과적으로 파악할 수 있게 해주며, 최근 대형 언어 모델의 표준적인 위치 인코딩 방식으로 자리 잡았다.
청크 단위 처리(Chunk-wise Processing)
연속적인 데이터 스트림을 고정된 시간이나 크기의 덩어리(청크)로 나누어 처리하는 방식이다. 비디오 스트리밍에서 실시간성을 확보하기 위해 전체 영상을 기다리지 않고 부분적으로 즉시 처리할 때 사용한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 04.수집 2026. 03. 06.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.