본문으로 건너뛰기

VideoChat3: 효율성과 범용성을 갖춘 완전 공개 비디오 MLLM

I3D-ViT와 적응형 프레임 해상도, 3종의 대규모 데이터셋을 결합해 4B 파라미터 모델이 장기·스트리밍·미세 동작 이해에서 오픈 소스 상위 성능과 실행 효율을 달성했다.

용어 해설

Inflated 3D Vision Transformer(I3D-ViT)
2차원 이미지 토크나이저의 공간적 self-attention을 연장하여 짧은 프레임 청크 내에서 시공간 self-attention을 수행하고 청크 단위로 시간적 풀링을 적용해 모션 정보를 보존하면서 토큰 수를 크게 줄이는 비전 인코딩 구조이다. 로컬 시공간 상호작용을 미리 모델링하여 LLM에 전달되는 시퀀스 길이를 감소시키는 점이 핵심이다.
청크 단위 시간 풀링(Chunk-wise Temporal Pooling)
연속된 T프레임을 하나의 청크로 묶어 내부에서 시공간 self-attention을 수행한 뒤 시간 축으로 집계하여 청크당 출력 토큰 수를 T배로 줄이는 연산이다. 입력 해상도를 유지한 채 로컬 중복을 제거해 LLM 단계의 계산량을 줄이는 데 중요하다.
적응형 프레임 해상도(Adaptive Frame Resolution)
스트리밍 환경에서 모델이 예측한 상태(silence/standby/response)에 따라 다음 윈도우의 총 픽셀 쿼터를 224^2 또는 448^2로 결정하여 평상시 저해상도로 모니터링하고 중요한 순간에만 고해상도로 관찰하는 입력 측 절약 기법이다. I3D-ViT의 가변 입력 크기 지원과 결합되어 실시간 비용 절감 효과를 만든다.
상태 전이 마스크(State-Transition Mask)
스트리밍 학습에서 모든 상태 토큰에 균일 손실을 주면 Silence에 편향되는 문제와 전이 위치만 학습하면 시각 증거 활용을 무시하는 문제가 공존한다. 전이 위치는 전부 유지하고 나머지 지속 위치에서 전이 수와 같은 수를 무작위로 골라 손실을 유지하는 방식으로 균형을 맞춘다.
시간 위치 인코딩(Temporal Positional Encoding)
청크 내 프레임 인덱스(0..T-1)에 대해 학습된 절대 시간 임베딩을 추가하여 동일한 공간적 포지셔널 임베딩을 유지하면서 프레임 순서를 구별하도록 하는 방식이다. 시공간 어텐션이 순서를 구분해 모션을 포착할 수 있게 만든다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 16.수집 2026. 07. 18.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.