본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

tencent/WeMM-Embedding-2B

텍스트·이미지·비디오·visual document의 multimodal feature-extraction2Bapache-2.0

텍스트·이미지·비디오를 2,048차원 벡터로 통합하는 Qwen3.5 기반 multimodal embedding 모델

TL;DR

WeMM-Embedding-2B는 Qwen3.5-2B를 기반으로 Fine-tuning한 universal multimodal embedding 모델입니다. 텍스트·이미지·비디오·visual document와 interleaved multimodal 입력을 받아 2,048차원 L2-normalized embedding으로 변환합니다. Sentence Transformers와 Transformers에서 독립 입력 또는 여러 모달리티를 섞은 입력을 처리하므로 멀티모달 검색과 유사도 계산에 적합하며, MMEB-v2 평균 점수 77.9로 동급 2B 모델 Qwen3-VL-Embedding의 73.2를 앞섰습니다.

핵심 포인트

  • 텍스트·이미지·비디오·visual document를 단일 2,048차원 L2-normalized embedding 공간으로 변환합니다.
  • 이미지·비디오를 텍스트와 결합하거나 여러 모달리티를 interleaved 순서로 넣어 하나의 입력으로 인코딩합니다.
  • Matryoshka Embeddings로 차원을 앞부분부터 줄여도 MMEB-v2 이미지·비디오 성능의 98.7%를 256차원에서 유지합니다.
  • Transformers와 Sentence Transformers를 지원하고 vLLM 0.27.0·SGLang 0.5.9에서 pooling 임베딩 서버로 구동합니다.

제한사항

  • Audio 입력은 지원하지 않으며, MMEB-v3의 Audio 태스크 점수는 0.0으로 집계됩니다.

벤치마크

벤치마크지표비교
MMEB-v2 AVGAVG77.9동일 2B Qwen3-VL-Embedding의 공개 수치 73.2보다 4.7점 높음
MMEB-v2 ImageHit@179.6동일 2B Qwen3-VL-Embedding의 공개 수치 75.0보다 4.6점 높음
MMEB-v2 VideoHit@170.8동일 2B Qwen3-VL-Embedding의 공개 수치 61.9보다 8.9점 높음
MMEB-v2 VisDocNDCG@580.7동일 2B Qwen3-VL-Embedding의 공개 수치 79.2보다 1.5점 높음
MMEB-v3 V3-AllV3-All56.0동일 2B Qwen3-VL-Embedding의 공개 수치 50.9보다 5.1점 높음
MMEB-v3 TextNDCG@545.3동일 2B Qwen3-VL-Embedding의 공개 수치 39.2보다 6.1점 높음
MMEB-v3 AgentHit@145.1동일 2B Qwen3-VL-Embedding의 공개 수치 39.3보다 5.8점 높음

68

LIKES

5.4k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.