query-based-segmentation
쿼리 기반 분할
쿼리 기반 분할은 learnable queries가 이미지 또는 영상 특징에 cross-attend하여 각 쿼리별로 객체 표현을 얻고 이를 마스크로 변환하는 방식이다. 이 방법은 쿼리 수와 객체 수를 분리하여 확장성을 확보할 수 있으며, SAM-MT에서는 각 사용자 지정 대상에 ID-인식 쿼리를 할당해 시간 축 추적을 가능하게 한다. 쿼리의 self-/cross-attention 구조와 마스크 디코더 연계가 성능과 정체성 유지에 결정적이다.