본문으로 건너뛰기
Roboflow Blog조회 1

SAM3와 Roboflow Workflows로 창고 이미지에서 텍스트 프롬프트 기반 자산 탐지하기

SAM3를 Roboflow Workflows에 연결해 이미지와 텍스트 프롬프트로 창고 자산의 바운딩박스와 개수를 즉시 반환하는 검색 워크플로를 구축하는 튜토리얼이다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 튜토리얼은 텍스트 프롬프트 기반의 detect anything 접근을 이용해 SAM3와 Roboflow Workflows로 창고 이미지에서 즉시 자산을 찾아 바운딩박스와 라벨, 개수 요약을 생성하는 워크플로를 구축하는 방법을 제시한다. 입력으로 이미지와 자연어 프롬프트를 SAM3 블록에 전달하면 모델이 일치하는 객체의 바운딩박스를 반환하고, 결과는 시각화와 Custom Python 블록의 집계로 이어져 별도 라벨링이나 재학습 없이 온디맨드 검색을 가능하게 한다. 전통적 검출기는 고정 클래스 학습과 재학습 주기가 필요하지만 detect anything 모델은 추론 시점의 텍스트로 클래스 목록을 대체하여 새로운 자산 도입 시 운영 비용과 시간을 줄일 수 있다는 점에서 창고 자산 추적에 실용적 이점을 제공한다.

섹션별 상세

01
전통적 객체 감지 파이프라인은 새로운 클래스 추가마다 이미지 수집·라벨링·재학습이 필요하여 운영 부담이 크다는 문제가 존재한다. 이 글에서는 텍스트 프롬프트를 입력으로 받아 이미지에서 해당 객체를 탐지하는 'detect anything' 접근을 제시하며, 사용자가 예시로 "forklift"나 "pallet" 같은 자연어를 넣으면 라벨링이나 학습 과정 없이 일치하는 모든 객체의 바운딩박스를 반환한다고 기술했다. 문서에서 제시한 예시와 워크플로 구조는 라벨 데이터 없이도 즉시 탐색 쿼리를 수행할 수 있다는 점을 근거로 새로운 자산이 등장했을 때 프롬프트만 바꾸면 된다는 운영상의 이점을 강조한다.
02
실습 파트는 Roboflow Workflows에서의 구현 절차를 단계별로 정리하며 입력 이미지와 텍스트 프롬프트를 SAM3 블록으로 전달하면 모델이 일치 객체의 바운딩박스와 라벨을 산출하고 그 결과를 바운딩박스 시각화와 실시간 객체 개수 오버레이로 보여준다고 기술했다. 이후 Custom Python 블록이 결과를 받아 감지된 자산 유형별 집계와 총 개수를 정리하는 출력 요약을 생성하는 흐름이 제시되어, 입력→모델→시각화→요약의 처리 파이프라인이 명확히 연결된다. 본 워크플로는 코드나 학습 없이도 온디맨드 객체 검색을 가능하게 하여 창고 내 장비 위치 파악과 자산 추적 작업을 간소화한다는 점에서 실무 적용 가치가 크다.
03
전통적 검출기와의 차이는 클래스 취급 방식에 있다. 글은 YOLO나 RF-DETR처럼 고정 클래스 집합을 라벨로 학습해 새로운 객체를 추가하려면 데이터 수집과 재학습이 필요하다고 밝히고, detect anything 모델은 클래스 목록 대신 추론 시 전달되는 텍스트 프롬프트를 사용해 이 루프를 건너뛴다고 설명했다. 창고 작업 맥락에서 문서는 근로자들이 비생산적 작업에 전체 노동시간의 약 30~40퍼센트를 소비한다고 제시하며, 이 접근법은 검색 문제를 단일 텍스트 프롬프트로 전환함으로써 장비 탐색에 소비되는 시간을 줄일 수 있다는 실무적 의미를 제시한다.

이미지 분석

워크플로 다이어그램으로 입력 이미지와 텍스트 프롬프트가 SAM3로 전달되어 바운딩박스와 레이블, 개수 요약으로 출력되는 처리 흐름을 시각화하고 있다.
Diagram

다이어그램은 전체 파이프라인의 입출력과 중간 처리 블록을 노드 및 화살표로 명확히 보여주어 워크플로 구현의 구조를 빠르게 이해하게 한다. 이미지에는 입력(warehouse image, text prompt), 처리(SAM3 블록), 어노테이션 시각화(바운딩박스·라벨·텍스트 카운트), 요약 출력 순서가 단계별로 표시되어 있어 글의 텍스트 설명과 대응되는 처리 흐름을 확인할 수 있다.

워크플로 다이어그램으로 입력 이미지와 텍스트 프롬프트가 SAM3로 전달되어 바운딩박스와 레이블, 개수 요약으로 출력되는 처리 흐름을 시각화하고 있다.

용어 해설

오픈 보캐뷸러리 객체 감지(Open-vocabulary Detection)
텍스트로 정의한 임의의 객체 이름을 입력으로 받아 이미지에서 해당 객체를 탐지하는 기법으로, 고정 클래스 집합을 학습하지 않고 추론 시점에 전달된 텍스트를 기준으로 바운딩박스를 반환해 새로운 객체를 학습 없이 즉시 탐지할 수 있다는 점에서 실무 적용 속도가 빠르다.
제로샷 객체 감지(Zero-shot Detection)
학습 데이터에 포함되지 않은 객체도 텍스트 설명만으로 탐지할 수 있는 접근법으로, 기존의 라벨링-재학습 사이클을 생략하고 텍스트 기반 쿼리로 즉시 탐지 결과를 생성하여 새로운 자산이 등장할 때마다 모델 재학습이 필요 없게 만든다는 점에서 운영 비용을 절감한다.
Segment Anything Model
이미지의 어느 부분이든 분할하거나 텍스트 쿼리에 대응하는 객체의 경계를 찾아내는 범용 세그멘테이션/감지 계열 모델로서, 프롬프트 기반의 개방형 감지 능력을 통해 고정 클래스에 얽매이지 않는 탐지 워크플로를 구현하게 해준다.
바운딩 박스(Bounding Box)
이미지 내 특정 객체의 위치와 크기를 사각형 좌표로 표현하는 방식으로, 감지 모델은 각 검출된 객체마다 바운딩 박스를 반환하고 이 좌표가 시각화와 후처리의 기본 입력이 되어 물체 개수 집계와 위치 기반 작업 흐름에 활용된다.

기술

  • SAM3
  • Roboflow Workflows
  • YOLO
  • RF-DETR
  • Custom Python

활용 사례

  • 창고 자산 추적
  • 현장 장비 검색
  • 온디맨드 객체 집계
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 08.수집 2026. 07. 08.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.