TL;DR
대규모 이미지-텍스트 검색 시스템은 이미지당 수백에서 천 개의 지역 토큰을 보관하고 쿼리마다 모두 비교해야 하므로 저장과 점수 계산 비용이 크게 증가한다. 본 논문은 단순한 토큰 축소가 아니라 쿼리 단위로 선택될 수 있는 객체 수준 증거를 보존하면서 대표 토큰 수를 크게 줄이는 접근을 제시해 비용과 성능의 균형을 맞췄다. 결과적으로 대규모 인덱스의 저장량과 검색 지연을 줄이면서도 객체·구문 수준의 정밀한 매칭을 유지할 수 있음을 실험으로 입증했다.
왜 중요한가
대규모 이미지-텍스트 검색 시스템은 이미지당 수백에서 천 개의 지역 토큰을 보관하고 쿼리마다 모두 비교해야 하므로 저장과 점수 계산 비용이 크게 증가한다. 본 논문은 단순한 토큰 축소가 아니라 쿼리 단위로 선택될 수 있는 객체 수준 증거를 보존하면서 대표 토큰 수를 크게 줄이는 접근을 제시해 비용과 성능의 균형을 맞췄다. 결과적으로 대규모 인덱스의 저장량과 검색 지연을 줄이면서도 객체·구문 수준의 정밀한 매칭을 유지할 수 있음을 실험으로 입증했다.
핵심 기여
검색 관점에서 시각 토큰 압축을 증거 보존 문제로 재정의
시각 토큰 압축을 단순한 중복 제거가 아니라 쿼리 토큰이 선택해야 할 객체·영역 증거를 보존하는 문제로 재구성했다. 이 관점은 feature 기반 병합이 서로 다른 객체 인스턴스를 동일 대표로 합쳐 증거를 소실시키는 실패 모드를 명확히 지목했다. 따라서 압축 방법의 목표를 증거 접근성 유지로 규정하고 그에 맞춘 설계를 진행했다.
사후 투영 토큰을 위한 객체 인식 병합(SaMer) 알고리즘 도입
사후 투영된 이미지 토큰을 feature 유사도와 공간적 근접도를 결합한 soft-assignment로 K개의 정규화된 centroid로 압축하는 절차를 제안했다. 학습 시 바운딩박스 라벨을 병합 우선으로 사용해 서로 다른 객체 인스턴스가 섞이는 것을 억제하고, 추론 시에는 라벨 없이 동일한 병합 규칙으로 작동하게 설계했다. 이 방식은 토큰 폐기 없이 대표 벡터로 정보를 집약해 late-interaction(MaxSim) 인터페이스를 유지한다.
투영 레이어만 적응시키는 projection-only 적응 전략
비전 인코더와 언어 백본은 동결시키고 공유 투영층만 학습하여 압축된 표현과 MaxSim 점수 계산 간의 불일치를 줄였다. 병합은 비모수적이며 centroid는 투영된 임베딩의 가중 평균으로 계산되어 투영층의 그래디언트가 병합된 표현을 통해 흐른다. 이 접근은 백본 변경 없이 압축에 적합한 검색 공간을 맞추는 현실적 비용-효율적 절차이다.
실험적으로 보존된 구문 수준 접지와 효율성 향상 입증
K=64일 때 이미지측 토큰을 93% 이상 제거하고 ColPali 저장량을 16.09×로 축소하면서 Flickr30K R@1을 77.0에서 82.4로, MSCOCO R@1을 47.4에서 51.6으로 향상했다. BoxMass, RegionHit, CoverageIoU 같은 구문 수준 지표에서 pruning·pooling 기반 압축보다 우수한 증거 집중도를 보였다. 또한 MaxSim 비교 횟수와 QPS 측면에서 실질적 효율성 이득이 확인되었다.
핵심 아이디어 이해하기
다중 벡터 기반의 late-interaction 검색에서는 쿼리의 각 토큰이 이미지 측 모든 지역 토큰과 비교되어 가장 유사한 토큰을 선택한다. 이 구조는 객체·속성·관계 같은 국소 증거를 포착할 수 있지만 이미지당 저장해야 할 토큰 수 N이 커질수록 저장 비용과 점수 계산량이 M×N에 비례해 급증하는 구조적 한계를 만든다. 따라서 대규모 인덱스에서는 토큰 수를 줄이지 않고서는 실용적 확장이 어렵다. SaMer은 단순히 토큰을 버리거나 전역 풀링으로 요약하는 대신 각 이미지의 post-projector 토큰을 feature 유사도와 공간적 일관성을 결합한 soft-assignment로 K개의 대표 centroid로 집약한다. 학습 시에는 바운딩박스 정보를 병합 우선(merge prior)으로 활용해 서로 다른 객체 인스턴스가 하나의 centroid로 섞이지 않도록 유도한다. 이렇게 하면 쿼리 토큰이 MaxSim으로 접근할 수 있는 객체-수준의 증거를 대표 토큰 내에 보존하면서 전체 토큰 수를 크게 줄일 수 있다. SaMer이 기존 pruning·pooling 기반 방법과 근본적으로 다른 점은 압축 목표가 '남는 정보의 양'이 아니라 '미래 쿼리들이 선택해야 하는 증거의 가용성'에 맞춰져 있다는 점이다. feature 만으로 유사한 패치를 묶으면 서로 다른 인스턴스가 동일 표현으로 붕괴될 수 있으나, 객체 인식 병합은 학습 시 라벨 기반 통계적 페널티로 cross-instance 혼합을 억제함으로써 구문 수준 접지 성능을 유지한다. 이로 인해 적은 K에서도 R@1·R@5 같은 검색 성능과 BoxMass·RegionHit 같은 접지 지표를 동시에 확보할 수 있다.
방법론
전체 파이프라인은 세 단계로 구성된다. 첫째, 동결된 비전·언어 백본으로부터 나오는 post-projector 비주얼 토큰 V={v_i}{i=1..N}과 쿼리 토큰 Q={q_j}{j=1..M}을 공유 투영층으로 동일 공간에 맵핑한다. 둘째, 각 이미지의 N개 토큰을 K≪N인 대표 centroid로 병합하는데, 병합 거리는 feature term과 spatial term을 합한 복합 거리로 계산되어 softmax 기반의 소프트 어사인먼트를 통해 가중치를 얻고 가중 평균으로 centroid를 구성한다. 셋째, 학습 시에는 객체 바운딩박스로부터 토큰별 인스턴스 레이블을 할당하고 대표별로 우세한 bbox 분포를 추정해 cross-instance 할당에 페널티를 추가하며, 추론 시에는 라벨 없이 feature-spatial 병합만 수행한다. 병합 세부는 두 축을 결합한 거리계산, soft-assignment 온도 τ_s, 그리고 공간 계수 γ의 조합으로 동작한다. 각 대표 r_k는 모든 토큰의 가중 합을 정규화한 결과이며, 압축 후의 검색 점수는 원래의 MaxSim 규칙을 그대로 사용하되 이미지 측 토큰 집합을 R(I)={r_k}_{k=1..K}로 대체한다. 이로써 쿼리-토큰 수준의 최대 유사도 선택 과정은 유지되며, 저장·점수 계산 비용은 K 기준으로 감소한다. 적응 전략은 projection-only 방식으로 제한된다. 병합 과정은 비모수적이며 centroid 계산은 투영된 임베딩으로부터 유도되므로, 압축된 MaxSim 점수로부터의 그래디언트가 투영층을 통해 흐르고 투영층 파라미터가 업데이트된다. 손실 함수는 multi-positive InfoNCE를 사용하여 긍정 이미지를 온도 τ로 스케일링한 exp 점수들의 비율을 로그로 취해 최적화한다. 이 구성은 백본을 그대로 유지하면서 압축된 표현에 적합한 검색 공간 정렬을 가능하게 한다.
관련 Figure

이 그림은 입력 이미지와 텍스트 쿼리가 각각 인코딩되어 공통 검색 공간으로 투영된 뒤 이미지측 post-projector 토큰이 K개의 대표로 병합되어 late interaction(MaxSim)으로 점수화되는 처리 흐름을 보여준다. 학습 시에만 객체 주석이 병합 우선으로 사용되고 추론 시에는 바운딩박스 없이 동일한 병합 규칙으로 동작한다는 설계 포인트가 다이어그램의 학습/추론 분기에서 확인된다.
SaMer 전체 파이프라인 다이어그램으로서, 동결된 비전·텍스트 인코더, 공유 투영층, feature-spatial 병합, 그리고 MaxSim 기반의 late interaction 흐름을 시각적으로 정리하고 있다.
주요 결과
메인 벤치마크에서 SaMer은 자연 이미지 검색에서 유의미한 향상을 보였다. ColPali 백본에 K=64를 적용한 경우 Flickr30K R@1은 77.0에서 82.4로 상승했고 MSCOCO R@1은 47.4에서 51.6으로 상승했다. ColQwen2 백본에서도 K=64일 때 Flickr30K R@1은 73.6에서 79.3으로 개선되어 동일한 토큰 예산 하에서 pruning·pooling 계열의 압축 기법보다 높은 검색 성능을 보였다. 구성 요소 분석에서는 feature-only 병합이나 spatial 항만 추가한 경우보다 객체 인식 병합이 주된 성능 향상 요인으로 확인되었다. Merge Component 실험에서 객체 인식 우선이 적용된 SaMer은 Flickr30K R@1을 82.4로 끌어올렸고 MSCOCO R@1을 51.6으로 향상시켰다. 토큰 예산 분석에서는 K가 32에서 64로 늘어날 때 성능 향상이 크고 K≥64에서는 추가 개선이 완만해져 K=64가 실무적 균형점으로 제시되었다. 구문 수준 접지(metric) 결과에서는 SaMer가 압축된 상태에서도 증거 집중도를 유지하거나 개선했다. training-free SaMer은 RegionHit를 10.5에서 62.8로, CoverageIoU를 2.1에서 11.7로 끌어올렸고 projection-only 적응을 거친 SaMer는 BoxMass를 41.3에서 54.2로, RegionHit를 68.3으로, CoverageIoU를 16.4로 향상시켜 압축 후에도 구문별 지역 증거가 올바른 객체에 집중되었음을 보여주었다. 효율성 측면에서 ColPali의 원래 이미지당 1,030개 토큰을 K=64로 압축하면 이미지측 저장량이 논문에서 보고한 바와 같이 16.09× 감소하고 MaxSim 비교 연산 또한 약 16.1× 감소해 QPS가 데이터셋별로 수배 향상되었다. 이 수치들은 인덱스 저장과 유사도 계산 비용을 동시에 낮춘다는 SaMer의 실용적 이점을 정량적으로 뒷받침한다.
관련 Figure

그래프는 K가 32에서 512로 증가할 때 R@5가 빠르게 수렴함을 보여주며 K=64 이후 성능 향득이 완만해지는 점을 강조한다. 동일한 K 예산에서 SaMer이 H-Pool, SAP, HPC 같은 압축 기법보다 높은 R@5 값을 갖는 것을 시각적으로 확인할 수 있어 K=64를 실용적 균형점으로 제시한 주장을 뒷받침한다.
토큰 예산 K에 따른 Flickr30K R@5와 MSCOCO R@5의 트레이드오프를 보여주는 그래프이다.

이 그림은 object-aware 병합과 projection-only 적응이 grounding 지표에서 유의미한 개선을 가져왔음을 정량적으로 보여준다. 특히 SaMer(학습된 버전)은 BoxMass와 RegionHit, CoverageIoU에서 다른 압축 방법들을 능가하여 압축 후에도 구문 수준 증거가 올바른 객체에 집중된다는 논문의 주장을 시각적으로 보강한다.
여러 압축 기법과 SaMer 변형의 BoxMass·RegionHit·CoverageIoU 지표를 비교한 막대그래프이다.
기술 상세
아키텍처는 동결된 비전 인코더와 텍스트 인코더, 그리고 학습 가능한 공유 투영층으로 구성되며 이미지 측 post-projector 토큰을 K개의 대표 centroid로 압축해 저장한다. 압축은 centroid 기반의 soft-assignment를 사용하며 centroid는 각 토큰의 가중 평균을 ℓ2 정규화한 결과로 형성된다. MaxSim 기반의 late-interaction 점수 계산 규칙은 유지되어 쿼리 토큰은 압축된 centroid들 중 최대 유사한 것을 선택한다. 거리 함수와 soft-assignment의 수리적 구성은 핵심적이다. 거리 함수는 feature term과 spatial term의 합으로 정의된다. 수식 원문: d(i,k)=(1−v_i^⊤μ_k)+γ‖p_i−s_k‖2^2. 변수 의미는 다음과 같다. v_i는 i번째 post-projector 토큰의 D차원 벡터, μ_k는 k번째 대표의 feature centroid, p_i는 i번째 토큰의 정규화된 2차원 공간 좌표, s_k는 k번째 대표의 공간 centroid, γ는 공간 항의 가중치이다. 계산 흐름은 각 (i,k) 쌍에 대해 d(i,k)를 계산하고 τ_s로 나눈 음수값에 softmax를 적용해 a{i,k}를 얻은 뒤 대표 r_k를 a_{i,k}로 가중 평균하여 정규화하는 방식이다. 작은 수치 예시는 논문 내 하이퍼파라미터 설정을 그대로 따르지만, 개념적으로 p_i와 s_k 거리 항이 클수록 공간적 불일치로 인해 해당 토큰의 해당 대표에 대한 할당 확률이 낮아진다. MaxSim 점수 구조는 다음과 같다. 수식 원문: S(q,I)=1/M ∑{j=1}^M max{i∈[N]} q_j^⊤ v_i, 압축 후에는 i 대신 k∈[K]로 치환되어 S_K(q,I)=1/M ∑{j=1}^M max{k∈[K]} q_j^⊤ r_k가 된다. 변수 의미는 q_j가 j번째 쿼리 토큰, v_i/r_k가 이미지측 토큰/대표이며 계산 흐름은 각 쿼리 토큰마다 이미지측 대표들과 dot-product를 취해 가장 큰 값을 골라 평균하는 것이다. 이 구조는 입력(쿼리 토큰과 압축된 대표) → dot-product 연산 → 최대값 선택 → 평균 집계로 이어지며 최대값이 클수록 해당 쿼리-이미지 쌍의 관련성이 높음을 의미한다. 객체 인식 병합의 구현적인 핵심은 학습 단계에서의 merge prior 산정이다. 각 토큰에 bbox 레이블 b_i를 할당하고 hard assignment c_i=argmin_k d(i,k)를 계산해 대표별로 우세한 bbox 분포 P_k(b)를 추정한 뒤 P_inst(i,k)=1−P_k(b_i)로 cross-instance 페널티를 산출한다. 최종 소프트 어사인먼트는 a_{i,k}=softmax_k(−(d(i,k)+P_inst(i,k))/τ_s)로 계산되어 cross-instance 할당에 낮은 가중치를 부여한다. 이 과정은 soft-assign centroid 계산에만 적용되며 hard assignment는 gradient 전파를 차단해 우세한 라벨 통계를 추정하는 데만 사용된다. 학습은 multi-positive InfoNCE 손실을 사용하며 압축된 MaxSim 점수 S_K(q,I)를 입력으로 삼는다. 손실 원문: L_ret=−log(∑{I^+∈P(q)} exp(S_K(q,I^+)/τ) / ∑{I∈B} exp(S_K(q,I)/τ)). 이 손실은 긍정 이미지 집합을 분자에, 배치의 모든 후보를 분모에 두어 긍정과 부정 간의 상대적 점수 차이를 키운다. 투영층 파라미터는 이 손실의 그래디언트를 통해 업데이트되며 병합은 비모수적이므로 추가적인 병합 파라미터는 존재하지 않는다.
한계점
학습 단계에서 객체 바운딩박스 주석이 필요할 경우 SaMer은 그 주석을 병합 우선으로 활용하므로 해당 주석이 전혀 없는 도메인에서는 객체 인식 페널티의 직접적 이득을 얻기 어렵다. 문서 이미지처럼 OCR 토큰과 레이아웃 신호가 핵심인 도메인에서는 공격적인 토큰 압축이 희소한 텍스트 증거를 제거할 위험이 있어 SaMer이 최적화된 선택이 아닐 수 있다. 또한 병합은 이미지 내 지역 표현을 대표로 요약하므로 매우 세밀한 픽셀 수준의 지역 구분이 필요한 응용에서는 추가적 보완이 필요하다.
실무 활용
SaMer은 기존 multi-vector retriever에 학습 없는 형태로 바로 적용 가능하며, projection-only 적응을 추가하면 백본을 동결한 채로 압축 친화적인 검색 공간을 확보할 수 있다. K=64와 같이 작은 토큰 예산에서도 높은 검색 품질과 구문 수준 접지를 유지하므로 대규모 이미지 인덱스의 저장·추론 비용 절감에 직접적으로 기여한다. GitHub 저장소가 공개되어 있어 실무 통합과 재현이 용이하다.
- 대규모 이미지-텍스트 검색 인덱스의 이미지 측 저장량과 검색 지연을 줄여야 하는 상업적 검색 서비스
- 쿼리 단위의 세부 객체·속성 매칭이 중요한 시나리오에서 메모리 제약 하에 late-interaction을 유지해야 하는 응용
- 압축된 인덱스에서 구문 수준 grounding 성능을 유지해야 하는 근거리 유사 이미지 판별 및 전자문서의 시각 항목 검색
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Post-Projector Tokens
- — 비전 및 텍스트 인코더의 출력이 공유된 검색 공간으로 투영된 뒤 인덱스에 저장되는 토큰 표현이다. SaMer 맥락에서는 이 토큰들을 직접 압축하여 저장 용량과 MaxSim 계산량을 줄이는 주체로 작동한다. 검색에서 각 쿼리 토큰은 이들 중 가장 유사한 토큰을 선택하여 매칭 근거로 사용한다.
- Late Interaction
- — 쿼리의 각 토큰을 이미지 측의 토큰 전체와 비교해 가장 높은 유사도를 취하고 이 값들의 평균으로 문서 점수를 계산하는 방식이다. SaMer은 이 인터페이스를 변경하지 않고 이미지 표현만 K개의 대표 centroid로 압축한다. 쿼리-토큰 수준의 미세한 증거 보존이 핵심 목표이다.
- Object-Aware Merging
- — 학습 시 제공되는 바운딩박스 라벨을 병합 우선(merge prior)으로 활용하여 서로 다른 객체 인스턴스가 동일 대표로 융합되는 것을 억제하는 병합 규칙이다. 이 우선은 훈련 단계에만 적용되고 추론 시에는 불필요하다. 결과적으로 문구 단위로 선택 가능한 객체 증거가 보존된다.
- Centroid Compression
- — 다수의 지역 토큰을 feature 유사도와 공간적 근접도를 결합한 soft-assignment 가중치로 평균화해 정규화된 대표 벡터로 압축하는 기법이다. SaMer은 이 방식으로 N개의 토큰을 K개의 정규화된 centroid로 축약하여 저장과 비교 비용을 줄였다. soft-assignment는 토큰 폐기를 피하고 정보 분포를 보존한다.
- Phrase-Level Grounding
- — 텍스트의 특정 구문(phrase)이 이미지 내 어느 객체나 영역과 연관되는지를 정량화하는 측정이다. SaMer 실험에서는 BoxMass, RegionHit, CoverageIoU 같은 지표로 압축 후에도 쿼리-토큰 관련 증거가 올바른 객체 영역에 집중되는지를 평가했다. 이 평가는 단순 검색 점수보다 증거 보존 성능을 더 직접적으로 반영한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
