텍스트 한 줄로 영상 속 모든 객체를 추적한다, Meta의 차세대 세그멘테이션 모델 SAM 3 공개
텍스트나 시각적 프롬프트를 통해 이미지와 비디오 내의 객체를 정밀하게 탐지, 분할 및 추적하며, 특히 방대한 오픈 보캐브러리 개념에 대한 전수 분할 능력을 갖춘 통합 모델이다.
TL;DR
Meta가 발표한 SAM 3는 이미지와 비디오 내의 객체를 자유자재로 분할하고 추적할 수 있는 차세대 통합 파운데이션 모델이다. 이전 세대인 SAM 2의 강력한 성능을 계승하면서도, 텍스트 프롬프트나 예시 이미지를 통해 특정 개념에 해당하는 모든 객체 인스턴스를 찾아내는 '프롬프트 기반 개념 분할(PCS)' 기능을 획기적으로 강화했다. 특히 기존 벤치마크보다 50배 이상 방대한 27만 개의 고유 개념을 포함한 SA-CO 데이터셋에서 인간 성능의 75-80%에 도달하며 독보적인 오픈 보캐브러리 대응 능력을 입증했다. 기술적으로는 이미지와 비디오를 단일 프레임워크에서 처리하며, 텍스트와 시각적 프롬프트를 결합한 복합 쿼리를 지원한다. 사용자는 특정 객체를 가리키는 텍스트를 입력하거나, 긍정 및 부정 박스를 배치하여 모델이 분할해야 할 대상을 정밀하게 조정할 수 있다. 비디오 처리에서는 실시간성을 극대화한 스트리밍 추론 모드를 지원하여 프레임이 입력되는 즉시 객체를 추적할 수 있는 유연성을 제공한다. 다만 스트리밍 추론 시에는 미래 프레임 정보를 활용할 수 없어 중복 탐지나 오탐지가 발생할 가능성이 있다는 기술적 제약이 존재한다. 그럼에도 불구하고 SAM 3는 기존 SAM 2의 API 구조를 유지하면서도 성능을 대폭 개선하여, 자율주행, 영상 편집, 의료 영상 분석 등 정밀한 객체 인식이 필요한 다양한 산업 분야에서 즉시 교체 가능한 강력한 도구로 자리 잡았다.
핵심 역량
- 텍스트 프롬프트를 이용한 이미지 내 객체 전수 분할
- 비디오 내 특정 객체의 실시간 추적 및 마스킹
- 점 및 박스 입력을 통한 대화형 객체 선택
- 긍정/부정 프롬프트 조합을 통한 분할 영역 정밀 조정
- 이미지 예시를 활용한 유사 객체 탐지
- 단일 프레임워크 기반의 인스턴스 및 의미론적 분할 동시 수행
강점
- SA-CO 벤치마크에서 인간 성능의 75-80% 달성
- 기존 벤치마크 대비 50배 이상 많은 27만 개 고유 개념 처리 가능
- SAM 2와 호환되는 API를 제공하여 기존 워크플로우에 즉시 도입 가능
훈련 방식
SAM 2 아키텍처를 기반으로 27만 개의 고유 개념을 포함한 대규모 SA-CO 데이터셋을 활용하여 오픈 보캐브러리 대응 능력을 강화한 통합 훈련 방식 적용
알아두면 좋은 것
- Meta Privacy Policy에 따른 사용자 정보 수집 및 동의가 필요한 Gated 모델임
- 스트리밍 추론 시 미래 프레임 참조 불가로 인해 오탐지 및 중복 트랙이 발생할 수 있는 제한사항 존재
- Transformers 라이브러리와의 공식 통합을 통해 Sam3Model, Sam3Processor 등 표준 API 지원
- 상업적 이용 시 주의가 필요한 Meta의 독자적 라이선스 적용
기술적 특징
- 오픈 보캐브러리 개념의 전수 분할을 지원한다. 짧은 텍스트 문구나 예시 이미지만으로 이미지 내에 존재하는 해당 개념의 모든 인스턴스를 누락 없이 찾아내며, 이는 기존 모델들이 특정 객체 하나에 집중하던 한계를 극복한 결과이다.
- 이미지와 비디오를 위한 통합 아키텍처를 채택했다. 별도의 모델 변경 없이 동일한 가중치와 프로세서로 정적 이미지의 분할과 동적 비디오의 객체 추적을 동시에 수행하여 워크플로우의 일관성을 보장한다.
- 텍스트와 시각적 프롬프트의 하이브리드 입력을 처리한다. 텍스트로 대상을 지정한 후 부정적 박스를 추가하여 특정 영역을 제외하는 식의 정교한 제어가 가능하며, 이를 통해 복잡한 장면에서도 사용자의 의도를 정확히 반영한다.
- 실시간 처리를 위한 스트리밍 추론 모드를 구현했다. 비디오의 모든 프레임을 미리 로드하지 않고도 프레임 단위로 입력을 받아 즉각적인 추적 결과를 반환하므로, 지연 시간이 중요한 실시간 애플리케이션에 적합하다.
- 인스턴스 분할과 의미론적 분할 결과를 동시에 출력한다. 개별 객체의 경계뿐만 아니라 장면 전체의 클래스 정보를 단일 추론 과정에서 제공하여 풍부한 시각적 이해를 돕는다.
차별점
- 단일 객체가 아닌 텍스트에 매칭되는 모든 인스턴스를 동시에 분할하는 능력
- 비디오 추적 시 스트리밍 모드를 지원하여 실시간성 확보
- 기존 SAM 시리즈 대비 압도적으로 확장된 오픈 보캐브러리 대응 범위
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SA-CO | Human Performance Ratio | 75-80% | vs Human performance |
| SA-CO Concepts | Unique Concepts Count | 270K | 50x more than existing benchmarks |
2.3k
Likes
1.8M
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.