전역 멀티모달 가이던스
MLLM에서 추출한 시퀀스 차원의 특징을 시간 축으로 풀링해 하나의 전역 표현으로 요약한 뒤, 이를 통해 비디오 토큰의 쿼리와 키를 affine 변환으로 조정하는 모듈이다. 이 조정은 self-attention 계산 전에 고수준 의미를 비디오 토큰에 주입하여 상호주체 상호작용과 로고 같은 추상 참조의 배치를 향상시킨다.