TL;DR
비디오 이해는 공간적 정보뿐 아니라 시간적 동작과 장기간 증거 연결을 필요로 해 계산량이 급증하는 문제가 있다. 이 논문은 비전 토크나이저 단계에서 시공간 중복을 조기에 압축하고 스트리밍 상황에서 입력 해상도를 동적으로 조절하는 구조를 도입하여 실시간과 장기 분석 모두에서 처리 비용을 줄였다. 또한 데이터 쪽에서 학술 재주석, 장기 동영상 합성, 온라인 스트리밍 QA를 통합해 다양한 시간 스케일에 견고하게 대응하는 완전 공개 학습 스택을 제공한다.
왜 중요한가
비디오 이해는 공간적 정보뿐 아니라 시간적 동작과 장기간 증거 연결을 필요로 해 계산량이 급증하는 문제가 있다. 이 논문은 비전 토크나이저 단계에서 시공간 중복을 조기에 압축하고 스트리밍 상황에서 입력 해상도를 동적으로 조절하는 구조를 도입하여 실시간과 장기 분석 모두에서 처리 비용을 줄였다. 또한 데이터 쪽에서 학술 재주석, 장기 동영상 합성, 온라인 스트리밍 QA를 통합해 다양한 시간 스케일에 견고하게 대응하는 완전 공개 학습 스택을 제공한다.
핵심 기여
I3D-ViT: 이미지 토크나이저를 시공간 토크나이저로 확장
이미지 기반 ViT를 기반으로 연속 프레임을 청크로 묶어 청크 내부에서 시공간 self-attention을 수행하고 청크 단위 시간 풀링을 적용해 입력 토큰 수를 청크 길이(T)와 2×2 공간 병합을 결합해 약 16배(예: T=4) 수준으로 압축한다. 이 구조는 로컬 모션 정보를 보존하면서 LLM에 전달되는 시퀀스 길이를 크게 줄여 장기 및 고프레임수 동영상 처리에서 효율을 확보한다. 사전 학습된 이미지 가중치를 초기화로 사용해 공간 인식 능력을 유지한 채 시공간 특성에 적응시키는 사전훈련 단계가 포함된다.
Adaptive Frame Resolution: 스트리밍에서의 동적 해상도 할당
스트리밍 루프에서 모델이 예측한 상태 토큰(silence/standby/response)에 따라 다음 윈도우의 픽셀 쿼터를 224^2 또는 448^2로 결정하는 결정 규칙을 적용한다. Standby 신호가 감지되면 다음 윈도우를 고해상도로 처리해 미세한 객체나 텍스트 같은 증거를 확보하고, Silence와 Response 이후에는 저해상도로 돌려 전체 비용을 절감한다. 이 정책은 I3D-ViT의 가변 입력 지원과 결합되어 별도 고해상도 인코더 없이도 실전 스트리밍에서 시각적 예산을 제어한다.
대규모 데이터 파이프라인과 재주석·합성된 학습셋 공개
학술 콘텐츠를 증거 기반으로 재주석한 VideoChat3-Academic2M, 장기 영상 합성 파이프라인으로 만든 VideoChat3-LV116K, 스트리밍용 온라인 응답 샘플 VideoChat3-OL617K를 구축해 총 3M 이상의 고품질 멀티모달 지침 데이터를 확보했다. 재작성·검증 루프에서는 강력한 VLM을 생성자와 판정자로 사용해 설명을 촘촘하게 늘리면서 원본 라벨과의 일관성을 확인해 허위 내용을 필터링했다. 데이터 구성은 단일 도메인 편향을 줄이고 장기 증거 집계와 온라인 응답 타이밍 학습을 동시에 가능하게 했다.
스트리밍 상태 전이 마스크와 교사 강제 시청 정책
스트리밍 학습에서 모든 상태 토큰에 균일 손실을 부여하면 Silence 편향이 발생하고 전이 위치만 학습하면 시각 신호 무시 문제가 생긴다. 논문은 전이 위치( s_t ≠ s_{t-1} )의 손실을 항상 유지하고 나머지 지속 위치 중 전이 수와 동일한 수만 샘플해 손실을 유지하는 state-transition mask를 도입해 전이 학습과 지속 판단을 균형시켰다. 또한 학습 시 다음 윈도우의 픽셀 예산을 교사 강제로 주어 모델이 상태 예측과 시각 예산 제어를 동시에 학습하도록 설계했다.
효율성·성능 균형을 검증한 광범위 벤치마크 평가
일반·장기·스트리밍 벤치마크에서 VideoChat3-4B는 MotionBench 61.7, TempCompass 75.6, ODVBench 72.3, OVO-Timing F1 35.5 등 주요 지표에서 동급 오픈 모델들을 능가하거나 경쟁력을 보였다. I3D-ViT는 프레임이 많은 입력에서 LLM에 전달되는 시퀀스 길이를 절반 수준으로 줄여 1024프레임에서 총 지연을 12.251s에서 8.099s로 단축하는 등 장기 입력에서 FLOPs와 메모리 이득을 입증했다. 벤치마크 결과는 아키텍처·데이터·스트리밍 정책의 조합이 실무적 성능 향상으로 연결됨을 보여준다.
관련 Figure

화면은 원본 질문과 간결한 정답을 재작성된 단계별 타임스탬프 근거 문장들로 확장해 최종 응답을 생성하는 과정을 보여준다. 이 예시는 논문이 학술 데이터의 라벨을 어떻게 증거-기반의 문장들로 촘촘히 늘려 학습 신호 밀도를 높였는지를 실무적 사례로 연결한다.
Annotation enhancement 예시로 짧은 정답을 시계열 근거 문장과 최종 요약으로 확장한 샘플 화면을 제시한다.
핵심 아이디어 이해하기
비디오 이해는 단일 프레임을 독립적으로 인식하는 방식으로는 짧은 모션이나 프레임 간 중복을 포착하지 못해 장기 문맥이나 실시간 스트리밍에서 비효율이 발생한다. 특히 LLM과 결합할 때 프레임마다 패치 수가 늘어나면 LLM 단계의 연산과 메모리 비용이 시퀀스 길이의 제곱에 비례해 폭증한다. 따라서 입력 단계에서 시공간 중복을 낮추고 로컬 모션 정보를 보존하는 방식이 필요하다.
방법론
핵심 해법은 비전 토크나이저 단계에서 시공간 모델링을 수행해 토큰 수를 줄이는 것이다. 구체적으로 이미지 사전학습 ViT을 초기화로 삼아 연속된 T프레임을 하나의 청크로 묶고 청크 내부에서 시공간 self-attention을 수행한 뒤 청크 단위로 시간 풀링을 적용해 출력 토큰을 압축한다. 이때 공간적으로는 2×2 병합(예: pixel shuffle)과 결합하여 T=4 설정에서는 전체적으로 약 16배의 시공간 압축을 달성한다.
관련 Figure

다이어그램은 입력 이미지/비디오의 원해상도를 유지하면서 pixel shuffle 및 MLP projector를 거쳐 청크 단위로 temporal pooling이 적용되는 처리 흐름을 보여준다. 오른쪽 박스는 패치 토큰화와 temporal/spatial positional encoding, variable-length self-attention의 결합 방식을 상세히 나타내어 I3D-ViT가 어떻게 로컬 시공간 상호작용을 캡처하고 토큰 수를 감소시키는지를 구조적으로 연결한다.
I3D-ViT와 패치화, 청크 단위 풀링, 가변 길이 self-attention 등 비전 인코더 파이프라인을 도식화한 아키텍처 다이어그램이다.

그림은 라이브 스트림에서 낮은 해상도의 연속 클립과 Standby 감지 시 고해상도 클립을 삽입해 적응적으로 퍼셉션 쿼터를 할당하는 흐름을 보여준다. 상단의 토큰 시퀀스와 매핑되어 모델이 언제 응답을 생성하는지, 그리고 학습 시 교사 강제 예산이 어떻게 다음 윈도우에 반영되는지를 일목요연하게 연결한다.
스트리밍 입력에서 클립별 저해상도/고해상도 정책과 LLM 토큰 시퀀스를 시간적으로 정렬해 보이는 스트리밍 처리 파이프라인 개요이다.
주요 결과
광범위한 평가에서 VideoChat3-4B는 여러 카테고리에서 우수한 균형 성능을 보였다. Temporal perception 항목에서는 MotionBench 61.7, TempCompass 75.6을 기록했고 장기 이해와 temporal grounding에서 TimeLens 계열과 VUE-TR, MomentSeeker 등에 대해 유의미한 향상을 보고했다. 스트리밍 평가에서는 ODVBench에서 72.3, OVO-Timing 평균 F1 35.5를 기록해 기존 공개 모델 대비 반응 타이밍과 온라인 메모리 유지 능력이 크게 개선되었음을 보였다.
관련 Figure

상단 차트는 여러 공개 모델 대비 VideoChat3의 벤치마크 점수를 막대그래프로 비교해 Temporal Perception, Long Video, Reasoning, Temporal Grounding, Online 등 여러 축에서의 성능 차이를 시각화한다. 중앙 타임라인은 스트리밍 루프에서 모델이 </Silence>, </Standby>, </Response> 상태를 어떻게 전환하고 실제 응답을 생성하는지를 예시 프레임과 함께 표시해 adaptive frame resolution과 상태 기반 입력 제어의 작동을 연결한다.
전반 성능 요약과 온라인 스트리밍 동작 예시를 결합한 도표로, 다양한 벤치마크 성적 비교와 스트리밍 응답 상태 시퀀스를 보여준다.
기술 상세
전체 아키텍처는 사전학습된 2D ViT, 경량 프로젝터, 그리고 autoregressive LLM의 고전적인 연결을 유지하되 비전 전단에서 I3D-ViT를 사용해 시공간 self-attention을 수행한다. I3D-ViT는 프레임 청크(group of T frames)를 입력으로 받아 프레임 내부의 패치들을 평탄화해 joint attention을 계산하고, temporal positional embedding을 더해 시간 순서를 보존한 뒤 청크-단위 풀링으로 토큰 수를 감소시킨다. 이렇게 생성된 compact visual tokens가 프로젝터를 통해 LLM 임베딩에 매핑되어 이후의 자연어 생성에 사용된다.
한계점
논문은 I3D-ViT가 LLM으로 전달하는 토큰 수를 절반 수준으로 줄여 장기 입력에서 큰 이득을 보였지만 비전 인코더에서의 연산 및 인코더 지연은 상대적으로 증가한다고 명시했다. 일부 벤치마크(예: VideoEval-Pro open split)에서는 성능이 소폭 하락한 항목이 존재해 모든 과제에서 일괄적으로 우위인 것은 아니다. 또한 데이터 합성과 재주석 과정은 강력한 VLM을 생성자·판정자로 사용해 품질을 보증했으나 자동화된 생성-검증 루프의 한계로 고유한 도메인 오류가 완전히 제거되지는 않을 수 있다.
실무 활용
실무 관점에서 VideoChat3의 설계는 장시간 녹화물의 이벤트 검색, 실시간 모니터링 도구, 그리고 사용자와의 프로액티브한 스트리밍 인터랙션에 직접 적용 가능하다. I3D-ViT의 조기 시공간 압축은 고프레임·고해상도 입력을 처리해야 하는 환경에서 LLM 비용을 낮춰 배포 가능성을 높인다. 공개된 코드와 학습 데이터는 조직 내부에서 재현 가능한 미세조정과 도메인 특화 데이터 추가를 허용한다.
- 장시간 CCTV 또는 드론 영상에서 이벤트 타임스탬프를 자동으로 추출해 포렌식 탐색 파이프라인의 전처리로 사용
- 라이브 스포츠 중계나 감시 스트림에서 중요한 순간에만 해상도를 높여 세부 증거를 확보하는 프로액티브 어시스턴트 구축
- 미디어 제작 워크플로에서 긴 촬영본의 요약·타임라인 생성 및 질의응답 인터페이스로 활용
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- I3D-ViT
- — 2차원 이미지 토크나이저의 공간적 self-attention을 연장하여 짧은 프레임 청크 내에서 시공간 self-attention을 수행하고 청크 단위로 시간적 풀링을 적용해 모션 정보를 보존하면서 토큰 수를 크게 줄이는 비전 인코딩 구조이다. 로컬 시공간 상호작용을 미리 모델링하여 LLM에 전달되는 시퀀스 길이를 감소시키는 점이 핵심이다.
- Chunk-wise Temporal Pooling
- — 연속된 T프레임을 하나의 청크로 묶어 내부에서 시공간 self-attention을 수행한 뒤 시간 축으로 집계하여 청크당 출력 토큰 수를 T배로 줄이는 연산이다. 입력 해상도를 유지한 채 로컬 중복을 제거해 LLM 단계의 계산량을 줄이는 데 중요하다.
- Adaptive Frame Resolution
- — 스트리밍 환경에서 모델이 예측한 상태(silence/standby/response)에 따라 다음 윈도우의 총 픽셀 쿼터를 224^2 또는 448^2로 결정하여 평상시 저해상도로 모니터링하고 중요한 순간에만 고해상도로 관찰하는 입력 측 절약 기법이다. I3D-ViT의 가변 입력 크기 지원과 결합되어 실시간 비용 절감 효과를 만든다.
- State-Transition Mask
- — 스트리밍 학습에서 모든 상태 토큰에 균일 손실을 주면 Silence에 편향되는 문제와 전이 위치만 학습하면 시각 증거 활용을 무시하는 문제가 공존한다. 전이 위치는 전부 유지하고 나머지 지속 위치에서 전이 수와 같은 수를 무작위로 골라 손실을 유지하는 방식으로 균형을 맞춘다.
- Temporal Positional Encoding
- — 청크 내 프레임 인덱스(0..T-1)에 대해 학습된 절대 시간 임베딩을 추가하여 동일한 공간적 포지셔널 임베딩을 유지하면서 프레임 순서를 구별하도록 하는 방식이다. 시공간 어텐션이 순서를 구분해 모션을 포착할 수 있게 만든다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.