본문으로 건너뛰기

OmniAssistBench로 측정한 영상 보조 모델의 한계

OmniAssistBench는 영상 보조 모델의 시각적 Prompt, 장기 기억, 목표 추적 능력을 멀티턴 상호작용으로 평가합니다.

용어 해설

옴니 모달 대규모 언어 모델(Omni-LLM)
텍스트뿐 아니라 영상과 오디오를 함께 입력으로 처리하는 대규모 언어 모델입니다. 여러 모달리티의 정보를 하나의 추론 과정에서 결합해 실시간 영상 보조, 음성 대화, 시각적 상황 파악 같은 작업을 수행하는 데 사용됩니다.
멀티턴 상호작용(Multi-turn Interaction)
사용자와 모델이 한 번의 질문과 답변으로 끝나지 않고 여러 차례 대화를 이어가는 방식입니다. 이전 답변과 사용자 목표를 다음 입력에 계속 반영해야 하므로, 대화 기록 유지와 시점별 상태 추적이 핵심입니다.
컨텍스트 윈도(Context Window)
모델이 한 번에 처리하고 기억할 수 있는 입력 토큰의 최대 범위입니다. 영상 프레임과 대화 기록이 이 한도를 넘으면 오래된 정보가 제거되거나 모델이 과거 상호작용을 잊어 이후 답변의 정확도가 떨어질 수 있습니다.
교사 강요(Teacher Forcing)
멀티턴 평가에서 이전 모델 답변 대신 정답 답변을 대화 기록에 넣어 다음 턴을 계산하는 방법입니다. 과거 답변의 오류 전파를 차단해 현재 턴 자체의 능력을 따로 측정하지만, 정답 기록이 있어도 영상과 목표를 연결하지 못하는 문제까지 해결하지는 못합니다.
선제적 응답(Proactive Response)
사용자 질문에 즉시 반응하는 것이 아니라 영상 속 목표 사건이 발생했을 때만 적절한 시점에 답하는 능력입니다. 모델은 현재 입력에 응답할 필요가 있는지 판단하고, 배경 음성이나 무관한 장면에는 [KEEP QUIET]를 출력해야 합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 21.수집 2026. 08. 25.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.