본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

tencent/WeMM-Embedding-9B

텍스트·이미지·비디오·시각 문서를 하나의 벡터 공간에 매핑하는 멀티모달 임베딩9Bapache-2.0

텍스트와 이미지·비디오를 4,096차원 벡터로 통합하는 Qwen3.5 기반 임베딩 모델

TL;DR

WeMM-Embedding-9B는 Qwen3.5-9B를 기반으로 한 fine-tune 계열의 범용 멀티모달 임베딩 모델로, 텍스트·이미지·비디오·시각 문서와 interleaved 입력을 하나의 표현 공간에 투영합니다. 입력을 Processor와 embedding 함수로 처리해 4,096차원 L2-normalized 벡터를 만들며, Sentence Transformers의 query·document 인코딩과 Matryoshka 차원 절단을 지원합니다. MMEB-v2에서 AVG 80.6, Image 81.9, Video 74.3, VisDoc 83.3을 기록했고, MMEB-v3 전체 190개 태스크에서는 59.5를 기록해 검색·매칭 중심의 멀티모달 시스템에 적합한 성능 근거를 갖췄습니다. 다만 오디오는 지원하지 않아 해당 태스크 점수는 0.0입니다.

핵심 포인트

  • Qwen3.5-9B를 기반으로 한 fine-tune 계열의 범용 멀티모달 임베딩 모델입니다. 텍스트, 이미지, 비디오, 시각 문서와 여러 양식을 섞은 입력을 동일한 인터페이스로 처리합니다. 오디오 입력은 지원하지 않아 오디오 검색까지 필요한 시스템에는 맞지 않습니다.
  • 입력 콘텐츠를 Processor로 전처리한 뒤 모델의 embedding 함수에 전달하면 4,096차원 L2-normalized 벡터를 반환합니다. Sentence Transformers에서는 문자열, URL, 파일 경로, PIL 이미지와 image·video·text를 묶은 dict를 encode_query 또는 encode_document로 처리합니다. 벡터 간 유사도를 계산하는 검색·매칭 파이프라인에 바로 연결할 수 있습니다.
  • Matryoshka Embeddings를 지원해 4,096차원 벡터의 앞부분을 원하는 차원으로 잘라 다시 정규화할 수 있습니다. Transformers에서는 embedding[..., :d]를 선택한 뒤 L2 정규화를 적용하고, Sentence Transformers에서는 truncate_dim과 normalize_embeddings=True를 사용합니다. 저장 공간과 검색 비용을 줄이면서 모델 설정에 등록된 차원을 선택할 수 있습니다.
  • vLLM 0.27.0의 pooling runner와 SGLang 0.5.9의 embedding 서버 구성을 제공해 배포 경로가 마련되어 있습니다. Transformers 사용 시 trust_remote_code=True와 Qwen VL 유틸리티가 필요하며, 비디오 처리를 위해 qwen-vl-utils와 decord 의존성이 포함됩니다. 멀티모달 검색 서비스를 운영할 때 입력 전처리와 서빙 구성을 함께 맞춰야 합니다.

제한사항

  • 오디오 입력을 지원하지 않으므로 MMEB-v3의 오디오 태스크 점수는 0.0으로 집계됐습니다.
  • 제공된 사용 예시와 언어 메타데이터는 중국어와 영어를 대상으로 하며, 다른 언어에 대한 성능 근거는 README에 없습니다.
  • Transformers 실행에는 trust_remote_code=True가 필요하고, 비디오 입력에는 qwen-vl-utils 및 decord 구성이 요구됩니다.

벤치마크

벤치마크지표비교
MMEB-v2AVG80.6기술 보고서 Table 1의 78개 데이터셋 기준 공개 수치이며, Qwen3-VL-Embedding 8B의 77.8보다 높음
MMEB-v2Image Hit@181.9기술 보고서 Table 1의 78개 데이터셋 기준 공개 수치이며, Qwen3-VL-Embedding 8B의 80.1보다 높음
MMEB-v2Video Hit@174.3기술 보고서 Table 1의 78개 데이터셋 기준 공개 수치이며, Qwen3-VL-Embedding 8B의 67.1보다 높음
MMEB-v2VisDoc NDCG@583.3기술 보고서 Table 1의 78개 데이터셋 기준 공개 수치이며, Qwen3-VL-Embedding 8B의 82.4보다 높음
MMEB-v3V3-All59.5기술 보고서 Table 2의 전체 190개 태스크 기준 공개 수치이며, Qwen3-VL-Embedding 8B의 53.5보다 높음
MMEB-v3Text NDCG@548.8기술 보고서 Table 2의 전체 190개 태스크 중 Text 결과이며, Qwen3-VL-Embedding 8B의 42.5보다 높음
MMEB-v3Agent Hit@151.0기술 보고서 Table 2의 전체 190개 태스크 중 Agent 결과이며, Qwen3-VL-Embedding 8B의 38.4보다 높음
MMEB-v3MCMR Hit@149.3기술 보고서 Table 2의 전체 190개 태스크 중 MCMR 결과이며, Qwen3-VL-Embedding 8B의 38.0보다 높음
MMEB-v3Audio Hit@10.0오디오 입력 미지원으로 집계된 값이며, 오디오를 지원하는 모델과 직접적인 기능 비교에는 주의가 필요함

83

LIKES

385

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.