본문으로 건너뛰기
HF Daily Papers조회 1

Gemini Embedding 2: Gemini로부터의 네이티브 멀티모달 임베딩 모델

Gemini Embedding 2는 텍스트, 이미지, 비디오, 오디오를 하나의 연합 표현 공간에 매핑한다. 멀티태스크 다단계 학습과 네이티브 멀티모달 이해를 통해 unimodal, cross-modal, multimodal 벤치마크에서 SOTA를 달성하며, RAG, 검색/추천 등 엔터프라이즈 애플리케이션에 직접 적용 가능성을 제시한다. 또한 네이티브 오디오 입력이 ASR 기반 파이프라인보다 검색 성능을 향상시키는 것을 실험적으로 입증한다.

용어 해설

노이즈 대조 손실(Noise-Contrastive Estimation (NCE) Loss)
노이즈 대조 손실은 배치 내 음성/양성 예시 간의 유사도를 최대화하고 부적합 예시를 최소화하는 학습 목표로, q_i와 p_i^+ 간의 코사인 유사도를 기반으로 한 확률 분포를 구성하여 역전파한다. 본 논문은 in-batch negatives를 활용하는 NCE 손실을 사용해 서로 다른 모달리티 쌍 간의 표현 정렬을 학습한다.
평균 풀링(Mean pooling)
입력 시퀀스의 토큰 임베딩들을 차원의 합을 토큰 수로 나눠 평균화하는 기법으로, 모달리티 간 서로 다른 시퀀스 길이를 통일된 단일 벡터로 축약하는 역할을 한다.
양방향 어텐션(Bidirectional Attention)
Transformer의 어텐션이 앞뒤 토큰 간 상호작용을 모두 고려하도록 하는 구조로, 입력 시퀀스의 각 토큰이 다른 모든 토큰과의 관계를 동시에 학습하도록 한다.
마트료시카 표현 학습(Matryoshka Representation Learning (MRL))
다중 차원 임베딩에 대해 서로 다른 차원 구간마다 별도의 손실을 적용해 다중 해상도 표현을 함께 최적화하는 학습 전략으로, 3,072 차원 임베딩에서 768/1536 차원에도 최적화를 병행한다.
모델 수프(Model Soup)
다양한 체크포인트를 평균해 일반화 성능을 향상시키는 기법으로, 본 논문은 FT의 여러 체크포인트를 평균하거나 서로 다른 학습 런의 가중치를 합성하는 방법을 제안한다.
Pre-Fine-Tuning / Fine-Tuning(Pre-Fine-Tuning (PFT) / Fine-Tuning (FT))
PFT는 인코더 형태로의 전환을 돕기 위해 다수의 노이즈 입력-타깃 쌍을 멀티태스크로 학습하는 초기 단계이며, FT는 텍스트/코드/문서/이미지/오디오/비디오 태스크를 포함한 대규모 데이터로 미세조정하는 단계이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 26.수집 2026. 05. 28.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.