용어 해설
- 멀티모달 대형 언어 모델(MLLM)
- — 멀티모달 입력(이미지/비디오와 텍스트)을 함께 처리하도록 사전학습된 대형 언어 모델로, 시각 정보의 프레임별 표현을 텍스트 생성 헤드로 연결하여 시각-언어 작업을 수행한다. 본 논문에서는 오프라인·온라인 형태의 MLLM을 동일한 벤치마크에서 평가 대상 모델군으로 삼아 프로액티브 알림과 대화형 상호작용 성능을 비교하는 핵심 축이 된다.
- 사전 알림 태스크(Proactive Reminder)
- — 연속 영상 스트림을 모니터링하며 위험이나 네비게이션 관련 이벤트를 사전에 탐지해 사용자에게 경고를 생성하는 태스크로, 단일 프레임 판정이 아닌 시간적 문맥과 이벤트 발생 전후의 정렬된 타임스탬프를 요구한다. VIABench에서는 21개의 세분화된 서브태스크와 시간 정렬 주석을 통해 이 능력을 평가한다.
- 일인칭(ego) 동영상(Egocentric Video)
- — 사용자 시점으로 촬영된 동영상으로, 카메라 흔들림·오버노출·프레이밍 실패 같은 현실적 노이즈가 자주 포함된다. VIABench는 시각장애인이 직접 촬영한 일인칭 영상을 주요 원천으로 삼아 실제 보조 상황에서 발생하는 영상 열화와 비정형 시점 문제를 포괄한다.
- 시각 기반 상호작용(Vision-Guided Interaction)
- — 모델이 사용자 의도에 따라 반복적이고 단계적인 지시를 제공하며 사용자의 물리적 동작 변화에 따라 안내 내용을 갱신하는 멀티턴 폐쇄형 상호작용 태스크이다. VIABench에서는 보정된 시뮬레이션 비디오를 포함하여 대상 조작이나 위치 조정을 완료할 때까지의 연속 지시 능력을 평가한다.
- 토큰 수준 프롬프트 활성화 디코딩(Token-Level Prompt Activation Decoding)
- — 오프라인 MLLM을 프레임 단위의 사전 알림 탐지기로 전환하는 경량 적응 기법으로, 프롬프트와 모든 프레임 토큰을 단일 시퀀스로 입력하여 각 프레임의 마지막 토큰 히든스테이트를 언어모델 헤드로 사영하고 특정 응답 토큰(A/B)의 로짓을 통해 경고 확률을 산출한다. 한 번의 순전파로 전체 비디오에 대한 프레임별 활성화 확률을 얻으므로 계산 비용을 크게 낮춘다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



