본문으로 건너뛰기

ENEAS: 의미 검증을 결합한 텍스트 기반 영상 분할

ENEAS는 시간 메모리와 선택적 VLM 검증으로 객체 추적과 의미 기반 분할을 통합한다.

용어 해설

텍스트 프롬프트 분할(Text-Promptable Segmentation)
자연어로 지정한 대상의 픽셀 영역을 분리하는 기술입니다. 입력 문장을 이미지 영역 제안과 마스크 생성 과정에 연결해 특정 객체 추적이나 여러 인스턴스 탐색을 수행합니다.
시간 메모리(Temporal Memory)
이전 프레임의 객체 정보와 예측 마스크를 저장해 현재 프레임의 분할에 활용하는 구조입니다. 대상이 잠시 가려지거나 화면 밖으로 나가도 동일한 인스턴스의 정체성을 유지하는 데 쓰입니다.
임베딩 매칭(Embedding Matching)
이미지 영역과 텍스트를 벡터 표현으로 바꾼 뒤 두 표현의 유사도를 계산하는 방식입니다. ENEAS는 이를 이용해 명확히 맞거나 맞지 않는 후보를 빠르게 걸러내고, 애매한 후보만 다음 단계로 보냅니다.
의미 검증(Semantic Verification)
시각적 형태가 비슷한 대상이 실제로 질의한 개념에 속하는지 추가로 판단하는 과정입니다. 조각상이나 그림처럼 사람처럼 보이지만 사람이 아닌 후보를 VLM의 문맥·재질 판단으로 제거합니다.
불확실성 구간(Uncertainty Interval)
임베딩 점수가 명확한 승인과 거부 사이에 놓이는 범위입니다. 이 구간의 후보만 비용이 높은 VLM 검증으로 보내 전체 추론 비용을 줄이면서 의미적 정밀도를 유지합니다.
존재론적 모호성(Ontological Ambiguity)
대상의 외형은 질의 개념과 비슷하지만 실제 종류나 존재 상태는 다른 상황입니다. 이 논문에서는 그림 속 인물과 실물 조각상이 사람으로 오인되는 문제가 대표 사례입니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 03.수집 2026. 09. 09.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.