본문으로 건너뛰기
Roboflow Blog조회 3

오픈 보캐뷸러리 세그멘테이션

텍스트 프롬프트로 객체를 지정하면 SAM 3이 프롬프트를 인코딩해 이미지와 매칭하고 픽셀 단위 마스크를 한 번에 반환해 라벨링과 재학습을 건너뛸 수 있다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

오픈 보캐뷸러리 세그멘테이션은 고정 레이블 없이 텍스트 프롬프트로 임의 객체를 픽셀 단위로 분할하는 기술로, 초기에는 클래스 비의존 마스크를 생성한 뒤 CLIP류 모델로 점수화하는 두 단계 파이프라인을 사용했다. SAM 3은 텍스트 인코더·퓨전 인코더·마스크 디코더를 한 모델로 결합해 프롬프트와 이미지 특징을 직접 정합하고 presence 토큰으로 인스턴스 마스크를 한 번에 출력한다고 기술되어 있다. Roboflow Workflows 예시는 Car Parts 데이터셋을 활용해 'door'나 'wheel' 같은 프롬프트로 별도 라벨링이나 재학습 없이 분할 결과와 클래스별 커버리지 리포트를 산출하는 과정을 보여주며, 자동차 손상 검사 시장의 수요($1.43 billion, 2025)와 맞물려 라벨링 비용과 재학습 부담을 줄이는 실무적 효용을 제공한다.

섹션별 상세

01
오픈 보캐뷸러리 세그멘테이션은 고정된 레이블 집합에 의존하지 않고 텍스트로 기술한 임의의 객체 범주를 픽셀 수준으로 분할하는 작업이다. 초기 방법은 전체 이미지를 덮는 클래스 비의존 마스크 제안을 생성한 뒤 CLIP 스타일 임베딩으로 각 마스크와 텍스트 쿼리를 점수화해 일치 여부를 판정하는 두 단계 파이프라인을 사용했다. 이 방식은 마스크 생성과 텍스트 매칭이 독립적으로 실패할 수 있고 CLIP 매칭이 마스크 영역에서 훈련되지 않았다는 한계가 존재했다. 최신 접근은 이러한 분리된 단계를 단일 모델로 통합해 정확도와 일관성을 높이는 방향으로 진화했다.
02
SAM 3은 단일 모델 파이프라인으로 프롬프트 기반 콘셉트 세그멘테이션을 수행하는 사례로, 텍스트 인코더가 입력 프롬프트를 처리하고 퓨전 인코더가 텍스트 임베딩과 이미지 특징을 결합한 뒤 마스크 디코더가 presence 토큰을 통해 인스턴스 마스크를 직접 출력한다. 이 구조는 입력으로 받은 텍스트(예: 'door', 'bumper', 'wheel')와 이미지의 시각적 영역을 한 번의 추론으로 정합하여 픽셀 단위 마스크를 반환한다고 명시되어 있다. SAM 3의 단일 파이프라인 방식은 두 단계 접근에서 발생하던 독립적 실패 빈도를 줄여 전체 정합 품질을 개선할 가능성이 있다.
차량 이미지 위에 'door'와 'wheel' 같은 텍스트 레이블과 픽셀 마스크가 오버레이된 세그멘테이션 결과를 보여준다.
Infographic이미지는 SAM 3 스타일의 출력 예시로서 텍스트 프롬프트에 대응하는 픽셀 단위 마스크와 각 인스턴스의 신뢰도(예: 96%, 98%)를 시각적으로 전달한다. 이 비주얼은 모델이 프롬프트를 해석해 해당 부위의 인스턴스를 찾고 마스크로 반환한다는 주장을 보완하는 근거로 사용될 수 있다. 튜토리얼의 워크플로가 산출하는 주석 이미지와 커버리지 리포트를 한눈에 보여주는 용도로 적합하다.
03
이 튜토리얼은 Roboflow Workflows 내에서 SAM 3을 실행해 이미지와 쉼표로 구분된 텍스트 프롬프트를 입력하면 각 검출 인스턴스에 대해 픽셀 마스크를 겹쳐 표시한 어노테이션 이미지와 클래스별 커버리지 리포트를 출력하도록 워크플로를 구성한다. 예시로 Roboflow Universe의 Car Parts 데이터셋을 사용해 별도 라벨링이나 재학습 없이 차량 부품을 분할하는 흐름을 보여주며, 문서에는 SAM 3이 한 번의 처리로 모든 일치 항목에 대한 마스크를 반환한다는 기술적 동작이 명시되어 있다. 이러한 워크플로는 배치 처리나 자동화된 검사 파이프라인에 곧바로 통합할 수 있어 운영 투입 시 개발 작업량을 줄일 수 있다.

용어 해설

오픈 보캐뷸러리 세그멘테이션(Open Vocabulary Segmentation)
고정된 레이블 집합에 의존하지 않고 자연어 프롬프트로 임의의 객체 범주를 픽셀 단위로 분할하는 기술이다. 이미지 특징과 텍스트 임베딩을 매칭해 특정 단어와 일치하는 모든 인스턴스 마스크를 생성한다. 라벨 수집과 재학습 없이 새로운 클래스에 대해 즉시 적용 가능한 점이 핵심이다.
클래스 비의존 마스크 제안(Class-agnostic Mask Proposals)
이미지 내 모든 가능한 객체 영역을 클래스 구분 없이 제안하는 단계로, 입력 이미지를 기반으로 다수의 후보 마스크를 생성한다. 이후 텍스트 기반 점수화 모델로 각 후보가 쿼리와 얼마나 일치하는지 판정한다. 초기 오픈보캐뷸러리 파이프라인의 핵심 구성 요소였다.
퓨전 인코더(Fusion Encoder)
텍스트 인코더가 처리한 프롬프트 임베딩과 이미지 특징을 결합해 상호작용을 산출하는 네트워크 구성요소이다. 두 모달리티의 정보를 합쳐 특정 단어와 연관된 시각적 신호를 증폭시켜 마스크 생성기에 전달한다. 단일 모델 파이프라인에서 텍스트-이미지 정합도를 직접 확보하는 역할을 한다.
프레즌스 토큰(Presence Token)
모델이 주어진 프롬프트에 해당 객체의 존재 여부를 판단하고 인스턴스 출력을 제어하기 위해 사용하는 특별한 토큰이다. 마스크 디코더가 각 인스턴스의 존재 신호를 확인하고 실제 마스크를 생성할지 결정하는 데 쓰인다. 다수 인스턴스 처리에서 불필요한 출력 생성을 줄이는 데 유용하다.

기술

  • SAM 3
  • CLIP
  • Roboflow Workflows
  • Car Parts dataset

활용 사례

  • 자동 차량 손상 검사 자동화
  • 신규 부품 유형의 즉시 감지 및 분류
  • 데이터 라벨링 없이 빠른 프로토타이핑용 이미지 어노테이션
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 15.수집 2026. 07. 15.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.