본문으로 건너뛰기

mot

혼합 트랜스포머

각 모달리티마다 전용 expert를 두고, 층마다 하나의 공유된 self-attention을 통해 상호작용시키는 구조이다. 𝒩0-TWAM은 이 구조를 비대칭 폭으로 설계해 비디오 전문가는 넓게, 촉각·액션 전문가는 슬림하게 유지해 사전학습 시각 prior를 보존한다. 공유된 attention은 모달리티 간 완전한 주의 교환을 허용하면서 가중치 수준의 용량 분리를 실현한다.