본문으로 건너뛰기

Global Multimodal Guidance (GMG)

전역 멀티모달 가이던스

MLLM에서 추출한 시퀀스 차원의 특징을 시간 축으로 풀링해 하나의 전역 표현으로 요약한 뒤, 이를 통해 비디오 토큰의 쿼리와 키를 affine 변환으로 조정하는 모듈이다. 이 조정은 self-attention 계산 전에 고수준 의미를 비디오 토큰에 주입하여 상호주체 상호작용과 로고 같은 추상 참조의 배치를 향상시킨다.