본문으로 건너뛰기
HF Daily Papers조회 2

범용 멀티모달 임베딩의 성능과 효율 개선

WeMM-Embedding은 2단계 학습과 MRL로 2B에서도 MMEB-v2 77.9를 기록하고 9B에서 80.6을 달성했다

용어 해설

멀티모달 임베딩(Multimodal Embedding)
텍스트·이미지·비디오처럼 서로 다른 형식의 입력을 하나의 벡터 공간에 배치하는 표현 학습 방식입니다. 입력 간 의미적 유사도를 계산할 수 있어 검색, 추천, 분류의 공통 표현으로 활용됩니다.
대조 학습(Contrastive Learning)
서로 맞는 소스와 타깃의 임베딩 유사도는 높이고, 맞지 않는 후보의 유사도는 낮추도록 학습하는 방법입니다. 배치 안의 다른 타깃이나 별도로 수집한 hard negative를 비교 대상으로 사용합니다.
하드 네거티브(Hard Negative)
질의와 의미적으로 비슷하지만 정답은 아닌 후보입니다. 쉬운 오답보다 구별하기 어려운 후보를 학습에 넣어 모델이 세밀한 관련성 차이를 표현하도록 만듭니다.
지식 증류(Knowledge Distillation)
큰 Teacher 모델의 출력 분포나 관계를 작은 Student 모델이 모방하도록 학습하는 방식입니다. 정답 하나만 사용하는 대신 후보 간 상대적 유사도 정보를 전달해 소형 모델의 표현 품질을 높입니다.
마지막 토큰 풀링(Last-Token Pooling)
입력 끝에 전용 토큰을 추가한 뒤 Transformer의 마지막 층에서 해당 토큰의 은닉 상태를 전체 입력의 대표 벡터로 사용하는 방식입니다. 텍스트와 시각 토큰을 함께 처리한 결과를 하나의 임베딩으로 모읍니다.
의미 ID(Semantic ID)
임베딩을 양자화해 얻은 이산 식별자로, 데이터의 의미 분포를 나타내는 코드입니다. WeMM-Embedding은 코드별 밀도를 이용해 자주 반복되는 패턴은 덜 샘플링하고 희소한 패턴은 더 보존했습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 25.수집 2026. 08. 27.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.