본문으로 건너뛰기

Multimodal Embedding Model

멀티모달 Embedding Model

텍스트와 이미지처럼 서로 다른 형식의 정보를 벡터로 변환해 질의와 문서의 유사도를 계산하는 모델입니다. 이 글에서는 페이지 전체를 임베딩한 뒤 cosine similarity 또는 MaxSim으로 검색 결과를 정렬합니다. 구조화된 차트 JSON과 경량 text embedding 조합의 성능을 비교하는 기준으로 사용됩니다.