Tencent/WeMM-Embedding
Python0 / 0
텍스트, 이미지, 비디오를 아우르는 고성능 범용 멀티모달 임베딩 모델 제품군.
TL;DR
WeMM-Embedding은 Tencent WeChat Vision 팀이 개발한 범용 멀티모달 임베딩 모델 제품군으로, 텍스트와 시각 데이터를 통합하여 고품질 벡터 표현을 생성한다. Matryoshka Representation Learning을 활용해 임베딩 차원을 유연하게 조절할 수 있어, 메모리 효율성과 추론 속도를 최적화하면서도 MMEB-v2 및 v3 벤치마크에서 SOTA 수준의 성능을 달성했다. Transformers 및 vLLM 등 표준 프레임워크를 지원하여 실무 환경에 즉시 배포 가능하며, 다양한 멀티모달 검색 및 이해 태스크에 활용할 수 있다.
핵심 포인트
- 텍스트, 이미지, 비디오, 시각 문서 등 다양한 모달리티를 통합 처리하는 범용 멀티모달 임베딩 모델 제품군.
- Matryoshka Representation Learning(MRL)을 적용해 임베딩 차원을 유연하게 조절하며 성능 손실을 최소화.
- MMEB-v2 및 v3 벤치마크에서 기존 모델 대비 우수한 성능을 입증하며 SOTA 기록.
- Transformers, SentenceTransformers, vLLM, SGLang 등 주요 추론 및 서빙 프레임워크와 호환.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMEB-v2 | AVG | 80.6 | WeMM-Embedding-9B 기준 |
| MMEB-v2 | Image | 81.9 | WeMM-Embedding-9B 기준 |
| MMEB-v2 | Video | 74.3 | WeMM-Embedding-9B 기준 |
| MMEB-v3 | V3-All | 59.5 | WeMM-Embedding-9B 기준 |
이미지 분석

811
STARS
45
FORKS
+220
TRENDING
0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.