LLaViT
LLaViT는 대형 언어 모델을 Vision Transformer로 확장한 설계이다. 이 설계는 LLM이 비전 인코더로 동작하도록 시각용 QKV 투영을 별도 학습하고, 시각 토큰에 양방향 어텐션을 허용하며, 전역과 지역 시각 표현을 통합하는 세 가지 구조적 변경을 포함한다. 이러한 구조로 텍스트·이미지 간 모달리티 불일치 문제를 완화한다.