용어 해설
- 인스턴스 수준 대응(Instance-level Correspondence)
- — 텍스트 프롬프트 내 개별 인스턴스 설명과 시각 조건(예: 엣지, 깊이 지도) 상의 공간 영역을 1:1로 연결한 정보이다. 본 논문에서는 VLM이 텍스트에서 인스턴스 설명을 추출하고 SAM 기반 디코더로 해당 영역의 마스크를 예측해 이 대응을 구성했다. 이 대응은 생성 모델의 어텐션을 제약하는 correspondence mask를 만드는 핵심 입력으로 사용되어 인스턴스 간 속성 혼동을 줄이는 역할을 한다.
- 대응 마스크(Correspondence Mask)
- — 이미지 토큰과 텍스트 토큰 간의 어텐션을 제어하기 위해 구성된 행렬로, 특정 이미지 토큰이 오직 대응되는 텍스트 토큰만 참조하게 만드는 역할을 한다. 논문에서는 refined instance mask와 텍스트 토큰 집합을 이용해 M을 구성하고 log(M)을 어텐션 점수에 더해 관련 없는 상호작용을 억제했다. 이 기법은 인스턴스 수준의 강한 바인딩과 속성 혼동 감소에 직접 기여한다.
- 마스크 정제 모듈(Mask Refinement Module)
- — 예측된 인스턴스 마스크의 노이즈와 위치 오프셋을 보정하기 위해 설계된 경량 U-Net 기반 모듈이다. 입력으로 VLM이 예측한 마스크, diffusion 모델의 attention 기반 마스크, 신뢰도 점수, 이미지 잠재 특징을 받아 intra/inter-instance attention과 ResNet 블록을 통해 정제된 마스크를 출력한다. 정제 마스크는 신뢰도가 낮을 때 attention 신호에 더 의존하고 신뢰도가 높을 때 예측 마스크를 유지해 생성 신뢰도를 높인다.
- 공유 SEG 토큰(Shared SEG Token)
- — 하나의 인스턴스가 텍스트 내 여러 구절로 기술될 때 각 구절에 대응하는 <SEG> 토큰들의 표현을 결합해 하나의 통합 쿼리 표현을 만드는 전략이다. 논문에서는 여러 <SEG> 토큰의 최종층 히든 임베딩을 Concat으로 합쳐 SAM 디코더 입력용 단일 쿼리로 사용함으로써 동일 인스턴스에 대한 일관된 마스크 예측을 유도했다. 이는 중복 서술로 인한 마스크 불일치를 줄이고 다중 구절 참조 상황에서 성능을 향상시켰다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



