본문으로 건너뛰기

vision-language-models

시각-언어 모델

이미지와 텍스트를 동일한 임베딩 공간에서 이해하고 처리할 수 있도록 설계된 AI 모델로, CLIP이 대표적인 사례입니다.