비전-언어
비전-언어 과제는 이미지나 비디오 같은 시각 입력과 텍스트 입출력을 결합해 동작하는 문제 영역이다. 입력 단계에서 시각 신호를 토큰 혹은 특징 벡터로 변환하고 모델 내부에서 텍스트와 결합해 출력 텍스트를 생성하는 처리 흐름을 따른다. 멀티모달 LLM에서는 시각 모듈과 언어 모듈 간 표현 불일치가 성능 저해 요인으로 작용함이 관찰됐다.