QKV 투영
QKV 투영은 Transformer의 attention에서 Query, Key, Value를 생성하는 선형 변환을 의미한다. 각 모달리티별로 별도 QKV 투영을 학습하면 텍스트용 표상과 시각용 표상이 서로 간섭하지 않도록 분리할 수 있다. LLaViT는 시각 모달리티에 대해 별도의 QKV 투영을 학습하도록 구조를 변경했다.