TL;DR
오픈 보캐뷸러리 세그멘테이션은 고정 레이블 없이 텍스트 프롬프트로 임의 객체를 픽셀 단위로 분할하는 기술로, 초기에는 클래스 비의존 마스크를 생성한 뒤 CLIP류 모델로 점수화하는 두 단계 파이프라인을 사용했다. SAM 3은 텍스트 인코더·퓨전 인코더·마스크 디코더를 한 모델로 결합해 프롬프트와 이미지 특징을 직접 정합하고 presence 토큰으로 인스턴스 마스크를 한 번에 출력한다고 기술되어 있다. Roboflow Workflows 예시는 Car Parts 데이터셋을 활용해 'door'나 'wheel' 같은 프롬프트로 별도 라벨링이나 재학습 없이 분할 결과와 클래스별 커버리지 리포트를 산출하는 과정을 보여주며, 자동차 손상 검사 시장의 수요($1.43 billion, 2025)와 맞물려 라벨링 비용과 재학습 부담을 줄이는 실무적 효용을 제공한다.
섹션별 상세
- SAM 3은 프롬프트를 처리한 뒤 한 번의 패스로 모든 일치 항목에 대해 픽셀 단위 마스크를 반환한다. — 요약 및 본문 첫머리의 모델 설명 문단

- 튜토리얼은 Roboflow Workflows에서 이미지와 쉼표로 구분된 텍스트 프롬프트를 입력하면 주석 이미지와 클래스별 커버리지 리포트를 출력하도록 구성된다. — 튜토리얼 개요 및 워크플로 설명 부분
- 자동차 손상 자동화 검사 시장은 2025년에 $1.43 billion에 도달했다. — 차량 검사 사례와 시장 규모를 언급한 문단
용어 해설
- Open Vocabulary Segmentation
- — 고정된 레이블 집합에 의존하지 않고 자연어 프롬프트로 임의의 객체 범주를 픽셀 단위로 분할하는 기술이다. 이미지 특징과 텍스트 임베딩을 매칭해 특정 단어와 일치하는 모든 인스턴스 마스크를 생성한다. 라벨 수집과 재학습 없이 새로운 클래스에 대해 즉시 적용 가능한 점이 핵심이다.
- Class-agnostic Mask Proposals
- — 이미지 내 모든 가능한 객체 영역을 클래스 구분 없이 제안하는 단계로, 입력 이미지를 기반으로 다수의 후보 마스크를 생성한다. 이후 텍스트 기반 점수화 모델로 각 후보가 쿼리와 얼마나 일치하는지 판정한다. 초기 오픈보캐뷸러리 파이프라인의 핵심 구성 요소였다.
- Fusion Encoder
- — 텍스트 인코더가 처리한 프롬프트 임베딩과 이미지 특징을 결합해 상호작용을 산출하는 네트워크 구성요소이다. 두 모달리티의 정보를 합쳐 특정 단어와 연관된 시각적 신호를 증폭시켜 마스크 생성기에 전달한다. 단일 모델 파이프라인에서 텍스트-이미지 정합도를 직접 확보하는 역할을 한다.
- Presence Token
- — 모델이 주어진 프롬프트에 해당 객체의 존재 여부를 판단하고 인스턴스 출력을 제어하기 위해 사용하는 특별한 토큰이다. 마스크 디코더가 각 인스턴스의 존재 신호를 확인하고 실제 마스크를 생성할지 결정하는 데 쓰인다. 다수 인스턴스 처리에서 불필요한 출력 생성을 줄이는 데 유용하다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.