섹션별 상세
SAM 1은 대규모 데이터셋 SA-1B를 기반으로 학습되어 사전 정의된 카테고리 없이도 새로운 객체의 경계를 인식하는 제로샷 능력을 갖췄다. 무거운 Vision Transformer 인코더를 한 번만 실행하고 가벼운 디코더로 실시간 추론을 수행하는 구조를 채택했다. 이를 통해 CPU 환경에서도 50ms 수준의 빠른 응답 속도를 구현하며 다양한 도메인에 즉시 적용 가능하다.

SAM 2는 비디오 데이터의 시간적 연속성을 처리하기 위해 메모리 뱅크와 메모리 어텐션 구조를 도입했다. 과거 프레임의 특징과 사용자 프롬프트 정보를 FIFO 큐 형태의 메모리에 저장하여 객체가 가려지는 상황에서도 정체성을 유지하며 추적한다. 스트리밍 아키텍처를 사용하여 긴 비디오도 메모리 부하 없이 실시간으로 처리할 수 있는 성능을 보여준다.

SAM 3는 기하학적 프롬프트를 넘어 텍스트 기반의 개념 프롬프트를 지원하는 오픈 보캐블러리 분할 모델이다. 시각과 언어 특징을 정렬한 통합 백본을 사용하며 노란색 스쿨버스와 같은 의미론적 개념을 형상과 결합하여 이해한다. LLM을 AI 어노테이터로 활용한 SA-Co 데이터셋으로 학습되어 복잡한 배경 속 희귀 객체에 대한 인식 지능이 대폭 향상됐다.

Roboflow는 SAM 모델들을 Workflows와 Rapid 엔진에 통합하여 사용자가 수동 라벨링 없이 텍스트 설명만으로 모델을 배포하게 지원한다. 기존 객체 탐지 모델의 경계 상자를 SAM의 프롬프트로 입력하여 정밀한 마스크를 생성하거나, SAM 3를 직접 사용하여 제로샷으로 데이터셋을 구축하는 파이프라인 구성이 가능하다.

용어 해설
- 제로샷 전이(Zero-Shot Transfer)
- — 학습 데이터에 명시적으로 포함되지 않았던 새로운 도메인이나 객체에 대해 별도의 추가 학습이나 미세 조정 없이도 즉각적으로 높은 성능을 발휘하는 모델의 일반화 능력을 의미한다. 이는 대규모 데이터셋 학습을 통해 객체의 보편적인 특징을 파악했기에 가능하다.
- 오픈 보캐블러리 분할(Open-Vocabulary Segmentation)
- — 미리 정의된 고정된 클래스 목록에 의존하지 않고 자연어 텍스트로 표현된 임의의 객체 개념을 자유롭게 인식하고 분할하는 기술이다. 사용자가 입력하는 다양한 텍스트 프롬프트에 대응할 수 있어 범용성이 매우 높다.
- 마스크렛(Masklet)
- — 비디오의 여러 프레임에 걸쳐 시공간적으로 연결된 특정 객체의 마스크 집합을 의미하며 비디오 분할 및 추적의 기본 단위로 사용된다. 단일 프레임의 마스크를 넘어 시간 축에서의 연속성을 포함하는 개념이다.
- 메모리 뱅크(Memory Bank)
- — SAM 2 아키텍처에서 과거 프레임의 시각적 특징과 예측된 마스크 정보를 저장해두는 핵심 컴포넌트이다. 이를 통해 모델은 객체가 일시적으로 화면에서 사라지거나 다른 물체에 가려지는 상황에서도 해당 객체의 정보를 유지하며 추적을 지속할 수 있다.
기술
- SAM 1
- SAM 2
- SAM 3
- Roboflow Workflows
- Roboflow Rapid
활용 사례
- 자동 데이터 라벨링
- 비디오 객체 추적
- 오픈 보캐블러리 객체 분할
- 품질 검사 자동화
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 02. 05.수집 2026. 02. 21.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
