왜 중요한가
희소 검색은 역색인과 결합해 대규모 검색 시스템에서 비용과 해석성을 제공하는 반면, 기존 LSR은 주로 bidirectional encoder에 묶여 있었다. UEmbed는 decoder-only MLLM에서 단일 순방향으로 희소와 밀집 임베딩을 동시에 생성하고 역색인·고성능 서빙 스택과 호환되도록 설계해 실무적 배포 가능성을 확보했다. 따라서 멀티모달 환경에서도 희소 검색을 자연스럽게 사용 가능한 새로운 실용 대안을 제시한 연구이다.
핵심 기여
단일 디코더 백본에서 희소·밀집 임베딩 동시 생성
디코더 전용 MLLM에 N개의 학습 가능한 특수 토큰을 추가하고 어휘를 N개의 배타적 하위집합으로 분할해 각 특수 토큰이 그 하위집합에 대한 희소 가중치를 예측하도록 설계해 한 번의 순방향으로 sparse와 dense 임베딩을 출력했다.
어휘 분할 기반 희소 헤드와 FLOPS 정규화
k-means로 어휘를 분할해 각 특수 토큰을 주제별 전문가로 유도하고, FLOPS 정규자를 도입해 쿼리·문서 측 평균 가중치 제곱을 페널티해 희소성을 제어했다.
멀티모달 희소 검색의 대규모 평가와 실무성 검증
MMEB-v2와 BEIR에서 UEmbed-9B가 dense 71.8 및 sparse 71.0을 기록했으며, 혼합 점수·서빙 호환성·BrowseComp-Plus 실험에서 도구 호출 비용 절감 등 실무적 이점을 확인했다.
핵심 아이디어 이해하기
디코더 전용 모델은 causal attention으로 인해 단일 EOS 토큰만으로 거대한 어휘 차원을 예측하려 하면 표현 용량이 부족해진다. UEmbed는 입력 뒤에 N개의 학습 가능한 특수 토큰을 붙이고 어휘를 k-means로 N개의 배타적 하위집합으로 나누어 각 특수 토큰이 자신의 하위집합에 대한 희소 가중치를 예측하도록 한다. 이렇게 각 토큰이 서로 다른 의미적 방향을 담당하게 함으로써 단일 토큰 병목을 우회하고 동시에 EOS의 은닉으로부터 밀집 임베딩을 얻는 통합 표현을 만든다.
방법론
입력 시퀀스 끝에 N=16개의 특수 토큰을 추가해 각 특수 토큰이 이전 모든 토큰을 주목하도록 구성하고, 어휘 V를 전처리(악센트 제거·소문자화·공백 정리)로 압축한 뒤 k-means로 N개의 하위집합 V_{1}..V_{N}으로 분할한다. 각 특수 토큰의 최종 은닉 H_{s_k}에 대해 하위집합 내 항목별 선형 투영을 적용해 수식 w_{t}^{(k)}=log(1+ReLU(W_{t}^{(k)T}h_{s_k}+b_{t}^{(k)}))로 희소 가중치를 계산하고, 모든 하위벡터를 이어붙여 전체 희소 벡터를 구성한다. 밀집 임베딩은 특수 토큰 앞의 EOS 은닉을 사용하고, 학습은 dense·sparse InfoNCE 손실과 FLOPS 정규자 가중합으로 동시에 수행한다.
주요 결과
MMEB-v2에서 UEmbed-9B는 dense 71.8과 sparse 71.0을 기록해 동일 스케일 내부에서 두 모드 간 차이를 1.0포인트 이내로 좁혔고, 공개 데이터로 학습된 모델들 사이에서 최고 성능을 달성했다. BEIR 텍스트 벤치마크에서 UEmbed-9B는 dense 평균 nDCG@10 56.3, sparse 평균 55.2를 달성해 밀집·희소 모드 모두 강력한 경쟁력을 보였고 특히 희소 모드는 Echo-Mistral-SPLADE 수준의 성능을 보였다. 혼합(hybrid) 점수는 Text에서 +0.3, VisDoc에서 +0.5의 소폭 개선을 보였고 BrowseComp-Plus 실험에서는 sparse 모드가 검색 라운드 수를 줄이며 비용 효율 측면에서 이점을 보였다.
기술 상세
어휘 전처리를 통해 원래 248,320개였던 어휘를 악센트 제거·소문자화·공백 축소로 184,016개로 압축했고, 이 어휘를 k-means로 N=16 하위집합으로 분할해 각 특수 토큰이 자신에게 할당된 하위집합에 대해 선형 프로젝션으로 희소 가중치를 계산했다. 희소 소프트맥스의 역치 민감도를 완화하기 위해 sparse 온도 τ_{s}=32를 사용했고, FLOPS 정규자(쿼리·문서 측 평균 가중치 제곱 페널티)를 도입해 희소성을 제어했다. 학습 데이터는 공개 소스 3.94M 샘플을 혼합해 사용했고 멀티모달 하드 네거티브는 Qwen3-VL-Embedding-8B를 교사로 마이닝해 확보했다.
한계점
학습 코퍼스가 영어와 중국어에 편중되어 있어 희소 헤드의 다국어 커버리지가 제한적이며, 그 결과 다른 언어에 대한 활성화가 부족한 경향이 관찰된다. 대형 LLM 어휘의 특성상 비표준 서브워드나 '_alt' 같은 이상 토큰이 희소 활성 상위에 등장하는 사례가 있어 어휘 안정성 문제와 산출물 정제 필요성이 존재한다. 또한 비디오처럼 시공간적 밀도가 높은 입력에서는 단순히 프레임을 풀링해 평탄화한 희소 벡터가 용량 병목을 겪는 경향이 발견되어 모달리티별 추가 설계가 요구된다는 한계가 있다.
실무 활용
UEmbed는 한 번의 순방향으로 sparse와 dense 벡터를 동시에 생성하므로 인코딩 중복 비용이 없고, 생성된 희소 벡터는 표준 역색인에 바로 적재할 수 있어 대규모 서비스에 적용하기 적합하다. 또한 autoregressive 서빙 스택(vLLM 등)과 직접 호환되어 고처리량 배포가 가능하며, agentic 검색 도중 키워드 밀집 쿼리에서 도구 호출 비용을 낮추는 실무적 장점이 확인됐다. 따라서 검색 시스템이 정확도와 비용·해석성 사이의 균형을 맞추려는 배포 환경에 적합한 솔루션이다.
- 검색 인프라에서 역색인 기반 희소 검색과 임베딩 기반 밀집 검색을 하나의 모델로 통합해 하이브리드 점수를 적용하는 경우
- LLM 에이전트가 반복적으로 키워드 중심 쿼리를 발행하는 대화형 도구에서 검색 도구 호출 비용을 줄이는 경우
- 멀티모달 문서(VisDoc) 검색처럼 시각적 요소에 표면형 어휘 신호가 유의미하게 존재하는 업무에서 희소 표현의 해석성을 활용하는 경우
코드 공개 여부: 공개
코드 저장소 보기키워드
추가 이미지 분석

왼쪽에 decoder-only MLLM의 입력과 특수 토큰 배치가 보이고, 중간에는 각 특수 토큰의 은닉이 하위 어휘에 선형 투영되어 희소 벡터를 생성하는 흐름이 나와 있다. 우측 상단에는 희소 활성 사례, 하단에는 dense와 sparse 성능 바 차트가 배치되어 있어 방법·출력·성능을 한 그림에서 연결한 설계도 역할을 한다.
UEmbed 구조를 요약한 다이어그램으로 입력 시퀀스 뒤에 N개의 특수 토큰을 추가하고 어휘를 분할해 각 토큰이 해당 하위집합의 희소 가중치를 예측하는 흐름을 시각화한 그림이다.

막대값으로 UEmbed-2B가 Dense 평가에서 64.6, Sparse 평가에서 64.5를 기록했고 Dense-only와 Sparse-only가 각각 63.0과 63.4를 기록해 통합 모델이 단일 모드 전문가와 비슷하거나 더 나은 성능을 보였음을 수치로 보여준다. 이 시각 자료는 공동 학습이 성능을 해치지 않음을 직관적으로 뒷받침한다.
Dense 평가와 Sparse 평가에서 UEmbed-2B, Dense-only, Sparse-only의 MMEB-V1 성능을 막대그래프로 비교한 차트이다.

그래프는 sparse 풀링 전략의 점수가 온도가 커질수록(2→64) 안정적으로 상승하는 경향을 보이며, dense 풀링은 온도 변화에 상대적으로 둔감함을 보여준다. 이 자료는 sparse 소프트맥스에 대해 τ_{s}를 분리해 크게 설정한 설계 선택의 근거를 시각적으로 확인시켜 준다.
온도(temperature) 변수에 따른 dense와 sparse 풀링 전략의 MMEB-V1 평균 점수를 선 그래프로 나타낸 그림이다.

그래프는 특수 토큰 수 N이 16까지는 안정적 성능을 유지하다가 N=32에서 성능이 하락하는 경향을 보여 주며, 이는 하위 어휘 집합이 지나치게 작아져 대비(sequence length) 비용과 표현력 저하가 발생했음을 시사한다. 이 결과는 논문에서 N=16을 기본값으로 채택한 근거와 일치한다.
EOS 토큰 수(2,4,8,16,32)에 따른 dense·sparse 평균 점수를 박스플롯으로 비교한 그림이다.

각 모달 입력에 대해 모델이 활성화한 어휘 토큰 목록이 제시되어 있어 희소 표현이 입력의 의미적 요소(예: Singapore, SpaceX, speed 등)를 포착함을 확인할 수 있다. 또한 '_alt'와 같은 이상 토큰과 영어·중국어 편중 현상도 함께 드러나며 어휘 안정성과 다국어 범용성 한계가 시각적으로 보인다.
텍스트·이미지·비디오·Visual Document 사례별로 상위 활성화된 희소 토큰 상위 10개를 나열한 케이스 스터디형 시각 자료이다.
용어 해설
- InfoNCE 손실(InfoNCE)
- — 대조학습 목적의 확률적 손실로, 쿼리와 양성 문서 쌍의 유사도를 높이고 배치 내 음성 샘플과의 확률적 분포를 통해 상대적 순위를 학습하는 손실 함수이다. 논문에서는 dense는 코사인 유사도, sparse는 내적을 사용해 InfoNCE를 계산했고 온도 τ로 스케일링했다. 이 손실을 dense·sparse 모드에 각각 적용하고 가중합해 공동 학습을 진행했다.
- 학습형 희소 검색(Learned Sparse Retrieval (LSR))
- — 신경망이 어휘별 가중치를 예측해 희소 벡터를 생성하는 방법론으로, SPLADE 계열이 대표적이다. 토큰 수준 프로젝션과 시퀀스 풀링으로 문서의 어휘 확장을 수행하며 역색인으로 서비스할 수 있다. 본문에서는 LSR을 decoder-only MLLM으로 확장하는 것이 핵심적 배경이다.
- 디코더 전용 멀티모달 LLM(decoder-only MLLM)
- — 일방향(autogressive) 주의 메커니즘을 사용하는 멀티모달 대형언어모델로, 입력 뒤에 오는 특수 토큰이 이전 문맥을 집계할 수 있다는 구조적 성질을 가진다. 이러한 구조는 전통적 SPLADE의 전역 풀링을 직접 재사용하기 어렵게 만든다. UEmbed는 이 점을 오히려 활용해 특수 토큰을 추가해 희소 헤드를 만들었다.
- 어휘 분할 (k-means)(Vocabulary Partitioning (k-means))
- — 전체 어휘를 k-means 클러스터링으로 분할해 N개의 서로 배타적인 하위집합으로 나누는 기법으로, 각 특수 토큰이 특정 하위집합에 대해 가중치를 예측하도록 설계했다. 이렇게 하면 단일 토큰이 전체 어휘 차원을 예측하는 병목을 우회한다. 논문에서는 N=16을 기본값으로 사용했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.