용어 해설
- 마스크렛(Masklet)
- — 마스크렛은 비디오에서 객체를 시공간적으로 추적하기 위해 프레임 연속성으로 연결된 픽셀 단위 분할 마스크 집합이다. 이 논문에서는 밀집한 픽셀 분할을 시공간적으로 연속된 단위로 취급하여 객체의 형태 변화와 가려짐을 보존하는 증거로 사용한다. masklet은 정답의 시각적 근거를 검증 가능하게 만들기 때문에 언어적 추정이나 바이어스를 넘어선 설명 가능성 확보에 핵심적이다.
- 시공간 분할(Spatio-Temporal Segmentation)
- — 시공간 분할은 비디오에서 시간 축을 따라 연속적으로 나타나는 객체 영역을 픽셀 단위로 분할하고 추적하는 처리이다. 입력으로 연속 프레임을 받고 객체 마스크를 추론하여 시간에 걸친 객체 위치와 형태 변화를 출력하며, 행동 인과 관계와 같은 고차원적 추론의 근거로 쓰인다. 본 논문에서는 6 FPS 샘플링 단위로 밀집한 마스크를 생성하여 복잡한 동적 장면을 다루었다.
- 시간적 교집합비(tIoU)(tIoU)
- — tIoU는 예측한 시간 구간과 정답 구간의 교집합을 합집합으로 나눈 값으로서 시간적 정밀도를 측정한다. 입력으로 예측 시작·종료 타임스탬프와 정답 타임스탬프를 받아 교집합/합집합을 계산해 0~1 범위의 점수를 출력하며, 높은 값은 모델이 질문 해결에 필요한 핵심 시간대를 정확히 선택했음을 의미한다. 본 벤치마크의 시간 증거 평가는 tIoU와 IoP(Intersection over Prediction)를 병행했다.
- 𝒥 & ℱ 지표(𝒥 & ℱ)
- — 𝒥는 영역 유사성(Intersection-over-Union)을, ℱ는 마스크 경계 정밀도를 결합해 분할 성능을 종합적으로 평가하는 지표이다. 입력으로 예측 마스크와 정답 마스크를 받고 두 성분을 계산한 후 평균화하여 출력하며, 높은 값은 객체 형태와 경계가 잘 일치함을 의미한다. 본 논문은 S-Evidence 성능을 𝒥 & ℱ로 보고해 공간적 근거의 픽셀 수준 정확도를 정량화했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
