섹션별 상세
기존의 연속적 비디오 토큰화 방식은 반복적인 이진 탐색이나 훈련된 회귀 모델을 사용해 계산 오버헤드가 컸다. 이 연구는 비디오 토큰화 과정에서 시간적 중복성을 직접 활용하는 방식을 제안한다. 연속된 프레임 간 변화가 적은 위치의 토큰을 제거하는 적응형 토큰 할당 메커니즘을 적용했다. 이를 통해 정적인 장면은 압축하고 동적인 장면은 토큰을 유지하여 효율성을 높였다.
제거된 토큰을 복원하기 위해 Latent Inpainting Transformer(LIT)라는 경량화된 시공간 어텐션 아키텍처를 도입했다. LIT는 단일 인코더 패스와 한 번의 순전파만으로 추론을 완료하여 별도의 라우팅 네트워크가 필요 없다. TokenBench와 DAVIS 벤치마크 평가 결과, 기존 ElasticTok-CV 대비 31배, InfoTok 대비 2배의 추론 속도 향상을 기록했다.
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 06. 11.수집 2026. 06. 11.출처 타입 REDDIT
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.