멀티모달 사전학습
텍스트뿐 아니라 이미지·오디오·비디오 데이터를 함께 사용해 모델을 사전학습하는 방식으로, 서로 다른 입력 유형을 공통 표현공간으로 정렬하는 것이 핵심이다. 멀티모달 학습은 시각·청각 정보 기반 추론과 상호작용 능력을 향상시킨다. 데이터 조정과 정합성 유지가 성능에 큰 영향을 미친다.