facebook/sam3
이미지·영상 객체 분할과 추적other
Text·visual prompt로 이미지와 영상의 모든 객체 인스턴스를 분할·추적하는 open-vocabulary 모델
TL;DR
SAM 3는 이미지와 영상에서 text·point·box·mask 같은 prompt를 받아 객체를 감지하고 분할하며 추적하는 통합 foundation model입니다. 짧은 text phrase나 exemplar로 지정한 open-vocabulary 개념의 모든 인스턴스를 찾고, 이미지에서는 mask·bounding box·score를, 영상에서는 객체 ID와 프레임별 mask를 출력합니다. Transformers에서는 Sam3Model·Sam3VideoModel·Sam3TrackerModel 계열과 processor를 이용해 배치 처리와 streaming inference를 구성할 수 있습니다. SA-CO benchmark에서 270K 고유 개념을 대상으로 인간 성능의 75-80%를 기록해 대규모 개방형 개념 분할 용도에 맞습니다.
핵심 포인트
- 짧은 text phrase나 exemplar로 지정한 open-vocabulary 개념의 모든 객체 인스턴스를 한 번에 분할합니다.
- 이미지에서는 text·box·point·mask를 조합해 mask, bounding box, confidence score를 산출합니다.
- 영상에서는 text prompt로 일치하는 객체를 찾고 프레임 간 객체 ID와 mask를 유지하며 추적합니다.
- Streaming inference는 미래 프레임을 볼 수 없어 중복 객체와 false positive가 늘 수 있습니다.
제한사항
- Streaming inference에서는 미래 프레임을 활용하는 hotstart heuristics가 비활성화되어 false positive와 중복 track이 늘 수 있습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SA-CO benchmark | human performance | 75-80% | 270K unique concepts를 포함한 benchmark에서 인간 성능의 75-80% |
3.1k
LIKES
1.9M
DOWNLOADS
5 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.