본문으로 건너뛰기

모든 시각 토큰이 동일하게 중요한가: 객체 증거를 보존하는 SaMer 토큰 병합 방식

SaMer은 학습 시 객체 주석을 병합 우선으로 활용해 이미지 post-projector 토큰을 K=64 대표 centroid로 압축하여 저장을 16.09× 줄이고 Flickr30K R@1을 77.0에서 82.4로 개선한 방식이다.

용어 해설

사후 투영 토큰(Post-Projector Tokens)
비전 및 텍스트 인코더의 출력이 공유된 검색 공간으로 투영된 뒤 인덱스에 저장되는 토큰 표현이다. SaMer 맥락에서는 이 토큰들을 직접 압축하여 저장 용량과 MaxSim 계산량을 줄이는 주체로 작동한다. 검색에서 각 쿼리 토큰은 이들 중 가장 유사한 토큰을 선택하여 매칭 근거로 사용한다.
지연 상호작용 (MaxSim)(Late Interaction)
쿼리의 각 토큰을 이미지 측의 토큰 전체와 비교해 가장 높은 유사도를 취하고 이 값들의 평균으로 문서 점수를 계산하는 방식이다. SaMer은 이 인터페이스를 변경하지 않고 이미지 표현만 K개의 대표 centroid로 압축한다. 쿼리-토큰 수준의 미세한 증거 보존이 핵심 목표이다.
객체 인식 병합(Object-Aware Merging)
학습 시 제공되는 바운딩박스 라벨을 병합 우선(merge prior)으로 활용하여 서로 다른 객체 인스턴스가 동일 대표로 융합되는 것을 억제하는 병합 규칙이다. 이 우선은 훈련 단계에만 적용되고 추론 시에는 불필요하다. 결과적으로 문구 단위로 선택 가능한 객체 증거가 보존된다.
중심점 기반 압축(Centroid Compression)
다수의 지역 토큰을 feature 유사도와 공간적 근접도를 결합한 soft-assignment 가중치로 평균화해 정규화된 대표 벡터로 압축하는 기법이다. SaMer은 이 방식으로 N개의 토큰을 K개의 정규화된 centroid로 축약하여 저장과 비교 비용을 줄였다. soft-assignment는 토큰 폐기를 피하고 정보 분포를 보존한다.
구문 수준 접지(Phrase-Level Grounding)
텍스트의 특정 구문(phrase)이 이미지 내 어느 객체나 영역과 연관되는지를 정량화하는 측정이다. SaMer 실험에서는 BoxMass, RegionHit, CoverageIoU 같은 지표로 압축 후에도 쿼리-토큰 관련 증거가 올바른 객체 영역에 집중되는지를 평가했다. 이 평가는 단순 검색 점수보다 증거 보존 성능을 더 직접적으로 반영한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 06.수집 2026. 07. 08.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.