본문으로 건너뛰기

AuralSAM2: 피라미드형 오디오-비주얼 특징 프롬프트링으로 SAM2를 활성화

SAM2의 프롬프트 기반 분할은 오디오 신호를 프롬프트로 활용하는 데 한계가 있다. 기존 방법은 오디오를 텍스트/박스 프롬프트로 변환하거나 이미지 인코더에 어댑터를 주입해 오디오-비주얼 융합을 시도하지만, 프롬프트-오디오 간 명확한 연결이 부족하고 계산 비용이 증가한다. 본 논문은 AuralFuser를 통해 SAM2의 고정된 이미지 피처를 수정하지 않고 오디오를 외부 모듈에서 직접 융합해, Sparse와 Dense 프롬프트를 피라미드 구조로 생성함으로써 오디오의 크로스모달 신호를 계층적으로 보존한다. 또한 AudioCon으로 오디오를 기준으로 시각 피처를 정렬하도록 대조 학습을 설계해 시각 주도성으로 인한 성능 저하를 완화한다. 이로써 AVSBench(V1m)에서 Jaccard를 개선하고, SAM2 기반 SOTA 방법들보다 우수한 성능을 달성한다.

용어 해설

AuralFuser
SAM2에 외부 모듈로 부착되어 오디오-비주얼 특징을 융합하며 이미지 피처를 수정하지 않고 오디오 가이드를 프롬프트로 생성하는 핵심 모듈.
AudioCon
오디오를 중심으로 한 대조 학습(constrastive learning) 프롬프트로 시각 피처를 오디오 프로토타입으로 정렬하도록 유도하는 AudioCon.
피처 피라미드(Feature Pyramid)
SAM2의 패치 임베딩에서 다층 피처를 구성하여 초기-중간-말단 계층 간에 오디오 정보를 계층적으로 융합하는 구조.
Sparse Prompts
시각-언어 정보를 활용한 고수준 컨텍스트를 포착하는 낮은 밀도의 프롬프트 세트.
Dense Prompts
픽셀 수준의 오디오-언어 융합 시각 특징을 제공하는 고밀도 프롬프트 세트.
AudioCon
오디오 기반 대조 학습으로 시각-오디오 임베딩 간 정렬을 강화하는 손실 항목.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 14.수집 2026. 05. 19.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.