용어 해설
- 쿼리 기반 분할(Query-based Segmentation)
- — 쿼리 기반 분할은 learnable queries가 이미지 또는 영상 특징에 cross-attend하여 각 쿼리별로 객체 표현을 얻고 이를 마스크로 변환하는 방식이다. 이 방법은 쿼리 수와 객체 수를 분리하여 확장성을 확보할 수 있으며, SAM-MT에서는 각 사용자 지정 대상에 ID-인식 쿼리를 할당해 시간 축 추적을 가능하게 한다. 쿼리의 self-/cross-attention 구조와 마스크 디코더 연계가 성능과 정체성 유지에 결정적이다.
- 분리된 마스크 어텐션(Decoupled Masked Attention)
- — 분리된 마스크 어텐션은 글로벌 쿼리와 각 대상 쿼리의 상호작용을 허용하되 서로 다른 대상 쿼리 간 직접 참조를 차단하는 attention 마스크 구조이다. 소프트맥스 입력에 -∞ 마스킹을 적용해 대상별 간섭을 억제하고 글로벌 컨텍스트와는 공유하게 함으로써 정체성 보존과 정보 통합을 동시에 달성한다. 이 방식은 대상 수 증가에도 쿼리 간 계산 폭발을 막아 확장성을 확보한다.
- 희소 메모리(Sparse Memory)
- — 희소 메모리는 각 대상에 대해 전체 픽셀 수준의 밀집 토큰 대신 대상별 저차원 쿼리 토큰만을 순차적으로 저장하는 경량 시계열 저장소이다. FIFO 형태로 최근 T프레임과 초기 프레임의 대상 쿼리를 보관해 재식별과 장기 재출현에 대응하면서 VRAM 사용량을 H×W 밀집 토큰 대비 크게 줄인다. SAM-MT는 이 구조를 통해 대상 수 증가에도 메모리 사용을 완만하게 유지했다.
- 아이덴티티 트랜스포머(Identity Transformer)
- — 아이덴티티 트랜스포머는 현재 프레임의 대상 쿼리가 희소 메모리에 저장된 자기 대상의 히스토리만을 조회하도록 identity-aware 마스크를 적용해 업데이트하는 모듈이다. 각 대상의 쿼리는 자신의 시간적 시퀀스 인덱스들에만 어텐션을 수행해 메모리 오염과 ID 드리프트를 줄인다. 이로 인해 재식별과 일관된 마스크 전파가 안정화된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

