본문으로 건너뛰기

jina-embeddings-v5-omni: Locked Aligned Towers를 통한 Geometry-preserving Embeddings

다중 모달 검색과 RAG 파이프라인에서 텍스트 임베딩의 품질을 유지하면서 이미지, 비디오, 오디오를 같은 임베딩 공간으로 연결해야 한다. GELATO는 frozen 텍스트 인코더와 frozen 비텍스트 인코더를 유지하고, 작은 projector로 모달리티를 텍스트 공간에 정렬한다. 이로써 텍스트-기반 임베딩 성능을 유지하면서 비텍스트 입력도 효과적으로 검색 가능하도록 확장한다.

용어 해설

Frozen 인코더(Frozen Encoders)
VLM 스타일 아키텍처에서 텍스트 백본과 비텍스트 인코더를 고정시키고, 모달리티 간 정렬을 달성하기 위한 기법으로, 모달리티별 인코더의 가중치를 재학습하지 않고 소수의 학습 가능한 프로젝터로 텍스트 임베딩 공간에 매핑한다.
프로젝터(Projectors)
비텍스트 인코더의 출력을 텍스트 백본의 숨김 공간으로 매핑하기 위해 학습 가능한 선형 계층(fc_vision_2, fc_audio)을 도입하는 방식으로, frozen 텍스트 임베딩과의 호환성을 보장한다.
마트료시카 표현 학습(Matryoshka Representation Learning)
다단계(prefix) 차원 축소를 통해 점진적으로 표현 정보를 보존하는 트레이닝 전략으로, L_NCE 손실이 다수의 부분 차원에서 합산되도록 설계된다.
InfoNCE 손실(InfoNCE)
배치 내 양성 쌍과 음성 쌍의 코사인 유사도의 차이를 로짓으로 만들어 소프트맥스 확률을 얻고, 이를 로그 손실로 최적화하는 대조 학습 손실 함수이다.
LoRA 어댑터(LoRA adapters)
대상 모듈의 소수의 랭크-저차원 행렬만 학습시키는 파라미터 효율적 파인튜닝 기법으로, 기존 텍스트 백본의 LoRA 어댑터를 보존한 상태에서 모달리티 확장을 가능하게 한다.
VLM 스타일 아키텍처(VLM-style architectures)
Vision-Language Model 스타일 아키텍처로, 비텍스트 모듈의 출력을 텍스트 언어 모델의 입력으로 연결해 단일 시맨틱 임베딩 공간으로 매핑한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 08.수집 2026. 05. 13.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.