I3D-ViT
Inflated 3D Vision Transformer
2차원 이미지 토크나이저의 공간적 self-attention을 연장하여 짧은 프레임 청크 내에서 시공간 self-attention을 수행하고 청크 단위로 시간적 풀링을 적용해 모션 정보를 보존하면서 토큰 수를 크게 줄이는 비전 인코딩 구조이다. 로컬 시공간 상호작용을 미리 모델링하여 LLM에 전달되는 시퀀스 길이를 감소시키는 점이 핵심이다.
Inflated 3D Vision Transformer
2차원 이미지 토크나이저의 공간적 self-attention을 연장하여 짧은 프레임 청크 내에서 시공간 self-attention을 수행하고 청크 단위로 시간적 풀링을 적용해 모션 정보를 보존하면서 토큰 수를 크게 줄이는 비전 인코딩 구조이다. 로컬 시공간 상호작용을 미리 모델링하여 LLM에 전달되는 시퀀스 길이를 감소시키는 점이 핵심이다.