tencent/WeMM-Embedding-2B
텍스트·이미지·비디오·visual document의 multimodal feature-extraction2Bapache-2.0
텍스트·이미지·비디오를 2,048차원 벡터로 통합하는 Qwen3.5 기반 multimodal embedding 모델
TL;DR
WeMM-Embedding-2B는 Qwen3.5-2B를 기반으로 Fine-tuning한 universal multimodal embedding 모델입니다. 텍스트·이미지·비디오·visual document와 interleaved multimodal 입력을 받아 2,048차원 L2-normalized embedding으로 변환합니다. Sentence Transformers와 Transformers에서 독립 입력 또는 여러 모달리티를 섞은 입력을 처리하므로 멀티모달 검색과 유사도 계산에 적합하며, MMEB-v2 평균 점수 77.9로 동급 2B 모델 Qwen3-VL-Embedding의 73.2를 앞섰습니다.
핵심 포인트
- 텍스트·이미지·비디오·visual document를 단일 2,048차원 L2-normalized embedding 공간으로 변환합니다.
- 이미지·비디오를 텍스트와 결합하거나 여러 모달리티를 interleaved 순서로 넣어 하나의 입력으로 인코딩합니다.
- Matryoshka Embeddings로 차원을 앞부분부터 줄여도 MMEB-v2 이미지·비디오 성능의 98.7%를 256차원에서 유지합니다.
- Transformers와 Sentence Transformers를 지원하고 vLLM 0.27.0·SGLang 0.5.9에서 pooling 임베딩 서버로 구동합니다.
제한사항
- Audio 입력은 지원하지 않으며, MMEB-v3의 Audio 태스크 점수는 0.0으로 집계됩니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMEB-v2 AVG | AVG | 77.9 | 동일 2B Qwen3-VL-Embedding의 공개 수치 73.2보다 4.7점 높음 |
| MMEB-v2 Image | Hit@1 | 79.6 | 동일 2B Qwen3-VL-Embedding의 공개 수치 75.0보다 4.6점 높음 |
| MMEB-v2 Video | Hit@1 | 70.8 | 동일 2B Qwen3-VL-Embedding의 공개 수치 61.9보다 8.9점 높음 |
| MMEB-v2 VisDoc | NDCG@5 | 80.7 | 동일 2B Qwen3-VL-Embedding의 공개 수치 79.2보다 1.5점 높음 |
| MMEB-v3 V3-All | V3-All | 56.0 | 동일 2B Qwen3-VL-Embedding의 공개 수치 50.9보다 5.1점 높음 |
| MMEB-v3 Text | NDCG@5 | 45.3 | 동일 2B Qwen3-VL-Embedding의 공개 수치 39.2보다 6.1점 높음 |
| MMEB-v3 Agent | Hit@1 | 45.1 | 동일 2B Qwen3-VL-Embedding의 공개 수치 39.3보다 5.8점 높음 |
68
LIKES
5.4k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.