TL;DR
Gemini Embedding 2는 텍스트, 이미지, 비디오, 오디오를 하나의 연합 표현 공간에 매핑한다. 멀티태스크 다단계 학습과 네이티브 멀티모달 이해를 통해 unimodal, cross-modal, multimodal 벤치마크에서 SOTA를 달성하며, RAG, 검색/추천 등 엔터프라이즈 애플리케이션에 직접 적용 가능성을 제시한다. 또한 네이티브 오디오 입력이 ASR 기반 파이프라인보다 검색 성능을 향상시키는 것을 실험적으로 입증한다.
왜 중요한가
Gemini Embedding 2는 텍스트, 이미지, 비디오, 오디오를 하나의 연합 표현 공간에 매핑한다. 멀티태스크 다단계 학습과 네이티브 멀티모달 이해를 통해 unimodal, cross-modal, multimodal 벤치마크에서 SOTA를 달성하며, RAG, 검색/추천 등 엔터프라이즈 애플리케이션에 직접 적용 가능성을 제시한다. 또한 네이티브 오디오 입력이 ASR 기반 파이프라인보다 검색 성능을 향상시키는 것을 실험적으로 입증한다.
핵심 기여
네이티브 멀티모달 임베딩 모델
텍스트, 이미지, 비디오, 오디오, 문서를 포함한 입력을 단일 벡터 공간으로 매핑하는 임베딩 모델이다.
다중 태스크-다중 스테이지 학습
텍스트/이미지/비디오/오디오 및 교차 모달 태스크를 혼합한 멀티태스크 학습으로, NCE 손실과 in-batch negatives를 적용하며, MRL로 차원별 다중 손실 최적화를 수행한다.
대규모 벤치마크에서의 SOTA 달성
MSCOCO, Flickr30k, MSR-VTT, Vatex 등 멀티모달 벤치마크 및 MMTEB(멀티링구얼 텍스트 임베딩 벤치마크)에서 기존 모델 대비 강력한 성능을 보인다.
Native 오디오 이해의 이점
오디오를 원시 신호로 직접 임베딩에 사용하여 ASR 기반 파이프라인보다 검색 성능이 향상된다.
도메인 일반화 및 엔터프라이즈 적용성
천문학, 생물과학, 미술, 요리 등 다양한 도메인에서 제로샷 일반화가 우수하며, 엔터프라이즈 렌즈의 문서/멀티모달 검색에 적용 가능하다.
핵심 아이디어 이해하기
출발점: 기존 멀티모달 임베딩은 모달리티 간 상호작용을 충분히 활용하지 못하고, 단순한 엔코더 간 클립-유사도 방식에 의존하는 경우가 많다. 이러한 한계는 mixed-modality 입력에서의 시맨틱 정보 손실로 이어진다. 해결 원리: Gemini Embedding 2는 Gemini의 멀티모달 및 코드 중심 코어를 활용해 텍스트, 이미지, 오디오, 비디오를 토큰화하고 bidirectional attention을 갖는 Transformer로 처리한다. 그 출력은 mean pooling으로 하나의 고정 차원 벡터로 요약한 뒤 선형 프로젝션으로 목표 차원(E)으로 매핑한다. 학습은 다중 태스크/다중 스테이지 방식으로 진행되며, 각 태스크에 따라 텍스트-텍스트, 텍스트-다중 모달, 다중 모달 간 대칭 학습이 이루어진다. 결과적으로 모달 간 상호작용을 포착하는 공동 잠재 공간이 형성되며, 언어 태스크에서도 텍스트 전용 벤치마크에서 강한 성능을 보인다. 차별점: 1) 입력 원시 형식에서 바로 임베딩으로의 직접 처리(텍스트, 이미지, 비디오, 오디오의 네이티브 지원), 2) NCE 손실과 in-batch 네거티브를 사용한 다중 모달 간 연합 학습, 3) MRL로 차원 확장에 따른 다중 손실의 조합, 4) PFT/FT 및 모델 수프를 통한 robust한 멀티모달 표현 학습, 5) 네이티브 오디오를 통한 검색 품질 향상 및 도메인 일반화.
방법론
- 모델 구성: 입력 모달리티를 토큰화한 후, M으로 처리해 Tembed = M(T) ∈ R^{L×d_M}를 얻고, Pembed = P(Tembed)으로 평균 풀링한다. 이후 E = f(Pembed) ∈ R^d로 선형 프로젝션한다. 2) 학습 목표: q_i = f(mean_pool(M(t ⊕ q_i))), p_i^+ = f(mean_pool(M(p_i^+))), p_i^- = ...; 배치 B에서 L = (1/B) Σ_i [ - log exp(sim(q_i, p_i^+)/τ) / ( exp(sim(q_i, p_i^+)/τ) + exp(sim(q_i, p_i^-)/τ) + Σ_j mask(i,j) exp(sim(q_i, p_j^+)/τ) ) ] 로 정의된다. sim(x,y) = x^⊤y / (||x|| ||y||). mask(i,j)은 q_i = q_j 또는 p_i^+ = p_j인 경우 0, 그렇지 않으면 1이다. 3) 차원 확장: d = 3072인 임베딩에 대해 768/1536 차원의 하위 손실을 포함하는 MRL를 도입한다. 4) 학습 레시피: Pre-Fine-Tuning(PFT)에서 다중 태스크 샘플링, 대형 배치, 이미지/텍스트/코드 태스크 중심; Fine-Tuning(FT)에서 텍스트, 코드, 도큐먼트, 이미지, 오디오, 비디오를 포함한 대규모 태스크를 수행한다. 5) 모델 수프: 서로 다른 체인이나 체크포인트를 평균해 일반화 성능을 강화한다.
관련 Figure

모듈형 멀티모달 임베딩의 작동 원리를 직관적으로 제시하며, 입력 모달리티의 토큰화와 Transformer 기반 인코딩, pooling, 프로젝션이 하나의 연합 표현으로 이어지는 과정을 설명한다.
Gemini Embedding 2의 워크플로우를 시각화한 다이어그램으로, 텍스트/이미지/비디오/오디오를 하나의 벡터 공간으로 매핑하는 흐름을 보여준다.
주요 결과
멀티모달/단일 모달 벤치마크에서 강력한 성능을 보인다. UI/GUIEC 이미지-이미지, 텍스트-이미지, 이미지-텍스트, 텍스트-비디오 등 다수의 쌍에서 Gemini Embedding 2가 최상위 평균 점수를 달성했다. 예를 들면: GUIEC Image→Image Recall@1: 79.4; ImageNet Image→Image Recall@1: 83.6; Text→Image Recall@1: MSCOCO 62.9, Flickr30k 89.1; Text→Text Recall@1: MSCOCO 78.8, Flickr30k 97.4; Text→Video NDCG@10: Vatex 68.8, MSR-VTT 68.0; Document Retrieval NDCG@10: ViDoRe V2 64.9. MMTEB(Multilingual) Mean 69.9; MTEB Code Mean 84.0. MSEB(Audio) 실험에서 Native Audio 입력은 ASR 기반보다 검색 성능이 높고, PassageInLang 75.58, PassageCrossLang 72.56 등으로 향상된다(Table 3). 5.3-5.4 절의 Ablation 및 Fine-Tuning 분석은 PFT/FT의 차이가 image/video 태스크에 더 큰 개선을 주며, 도메인 데이터의 추가가 일부 out-of-domain 태스크를 약간 저하시킬 수 있음을 보인다. 8-9 페이지의 전체 결과는 MTEB(Multilingual)과 MTEB(Code)에서 Gemini Embedding 2가 기존 텍스트 전용 모델 대비 우수함을 확인시켜 준다.
관련 Figure

FT가 이미지/비디오 태스크에서 주로 성능 향상을 이끌고, 도메인별 fine-tuning이 특정 벤치마크에 집중될 수 있음을 시사한다. 전체적으로 모델 소프를 통해 균형 있는 성능 향상을 도모한다.
Pre-Fine-Tuning(Ft)과 Fine-Tuning(FT) 체크포인트 간의 멀티모달 eval 비교를 보여주는 레이더 차트/그래프
기술 상세
아키텍처: M은 Gemini로부터 초기화된 양방향 어텐션 Transformer이며, 입력 시퀀스 T의 길이 L 토큰을 처리한다. Mean pooling으로 Pembed를 얻고 f를 통해 차원 d의 임베딩 E를 산출한다. 손실: LCE 손실의 변형으로, q_i, p_i^+, p_i^-를 이용해 in-batch negatives를 활용하는 NCE 손실을 적용한다. 수식: L = (1/B) Σ_i [ - log exp(sim(q_i, p_i^+)/τ) / ( exp(sim(q_i, p_i^+)/τ) + exp(sim(q_i, p_i^-)/τ) + Σ_j mask(i,j) exp(sim(q_i, p_j^+)/τ) ) ]. 차원 확장: d = 3072로 설정하고, 768/1536 차원의 다중 손실(MRL)로 보정한다. 학습: Pre-Fine-Tuning(PFT)으로 멀티태스크 샘플링, 대형 배치, 이미지/텍스트/코드 중심 태스크 수행; Fine-Tuning(FT)에서 텍스트/코드/도큐먼트/이미지/오디오/비디오를 포함한 태스크를 학습한다. Model Soup: 서로 다른 체크포인트의 가중치를 평균화해 일반화 강화.
실무 활용
다중 모달 데이터를 포함하는 엔터프라이즈 검색, 추천, 문서/비디오 검색에서 바로 사용할 수 있다. 네이티브 멀티모달 임베딩은 파이프라인의 복잡도를 감소시키고, 다양한 도메인에서 제로샷 성능을 제공한다.
- RAG 시스템에서 텍스트-비디오-오디오-문서 검색에 еди일 임베딩 공간 사용
- 대규모 문서/비디오 검색 엔진에서 교차 모달 검색 및 랭킹
- 도메인 특화(미생물 MicroVQA, 천문 AstroLLaVA, Recipe1M 등) 제로샷 검색
- 엔터프라이즈 추천 시스템에서 멀티모달 신호를 활용한 개선
- 코드 검색 및 코드 인텔리전스에 대한 멀티모달 임베딩 활용(코드 관련 태스크에서 강한 성능)
코드 공개 여부: 미확인
키워드
용어 해설
- Noise-Contrastive Estimation (NCE) Loss
- — 노이즈 대조 손실은 배치 내 음성/양성 예시 간의 유사도를 최대화하고 부적합 예시를 최소화하는 학습 목표로, q_i와 p_i^+ 간의 코사인 유사도를 기반으로 한 확률 분포를 구성하여 역전파한다. 본 논문은 in-batch negatives를 활용하는 NCE 손실을 사용해 서로 다른 모달리티 쌍 간의 표현 정렬을 학습한다.
- Mean pooling
- — 입력 시퀀스의 토큰 임베딩들을 차원의 합을 토큰 수로 나눠 평균화하는 기법으로, 모달리티 간 서로 다른 시퀀스 길이를 통일된 단일 벡터로 축약하는 역할을 한다.
- Bidirectional Attention
- — Transformer의 어텐션이 앞뒤 토큰 간 상호작용을 모두 고려하도록 하는 구조로, 입력 시퀀스의 각 토큰이 다른 모든 토큰과의 관계를 동시에 학습하도록 한다.
- Matryoshka Representation Learning (MRL)
- — 다중 차원 임베딩에 대해 서로 다른 차원 구간마다 별도의 손실을 적용해 다중 해상도 표현을 함께 최적화하는 학습 전략으로, 3,072 차원 임베딩에서 768/1536 차원에도 최적화를 병행한다.
- Model Soup
- — 다양한 체크포인트를 평균해 일반화 성능을 향상시키는 기법으로, 본 논문은 FT의 여러 체크포인트를 평균하거나 서로 다른 학습 런의 가중치를 합성하는 방법을 제안한다.
- Pre-Fine-Tuning (PFT) / Fine-Tuning (FT)
- — PFT는 인코더 형태로의 전환을 돕기 위해 다수의 노이즈 입력-타깃 쌍을 멀티태스크로 학습하는 초기 단계이며, FT는 텍스트/코드/문서/이미지/오디오/비디오 태스크를 포함한 대규모 데이터로 미세조정하는 단계이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.