본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Tencent/WeMM-Embedding

Python0 / 0

텍스트, 이미지, 비디오를 아우르는 고성능 범용 멀티모달 임베딩 모델 제품군.

TL;DR

WeMM-Embedding은 Tencent WeChat Vision 팀이 개발한 범용 멀티모달 임베딩 모델 제품군으로, 텍스트와 시각 데이터를 통합하여 고품질 벡터 표현을 생성한다. Matryoshka Representation Learning을 활용해 임베딩 차원을 유연하게 조절할 수 있어, 메모리 효율성과 추론 속도를 최적화하면서도 MMEB-v2 및 v3 벤치마크에서 SOTA 수준의 성능을 달성했다. Transformers 및 vLLM 등 표준 프레임워크를 지원하여 실무 환경에 즉시 배포 가능하며, 다양한 멀티모달 검색 및 이해 태스크에 활용할 수 있다.

핵심 포인트

  • 텍스트, 이미지, 비디오, 시각 문서 등 다양한 모달리티를 통합 처리하는 범용 멀티모달 임베딩 모델 제품군.
  • Matryoshka Representation Learning(MRL)을 적용해 임베딩 차원을 유연하게 조절하며 성능 손실을 최소화.
  • MMEB-v2 및 v3 벤치마크에서 기존 모델 대비 우수한 성능을 입증하며 SOTA 기록.
  • Transformers, SentenceTransformers, vLLM, SGLang 등 주요 추론 및 서빙 프레임워크와 호환.

벤치마크

벤치마크지표비교
MMEB-v2AVG80.6WeMM-Embedding-9B 기준
MMEB-v2Image81.9WeMM-Embedding-9B 기준
MMEB-v2Video74.3WeMM-Embedding-9B 기준
MMEB-v3V3-All59.5WeMM-Embedding-9B 기준

이미지 분석

MMEB-v2 벤치마크에서의 모델 크기별 성능과 주요 태스크별 성능 비교 차트.
왼쪽 차트는 모델 파라미터 크기(2B~9B)에 따른 MMEB-v2 성능 추이를 보여주며, WeMM-Embedding이 전반적으로 높은 성능을 유지함을 나타낸다. 오른쪽 막대 그래프는 이미지, 비디오, 교차 모달 검색 등 세부 태스크에서 WeMM-Embedding이 타 모델 대비 우위를 점하고 있음을 시각화한다.

811

STARS

45

FORKS

+220

TRENDING

0

조회수

watchers 811open issues 3Other

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.