본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

facebook/sam3

이미지·영상 객체 분할과 추적other

Text·visual prompt로 이미지와 영상의 모든 객체 인스턴스를 분할·추적하는 open-vocabulary 모델

TL;DR

SAM 3는 이미지와 영상에서 text·point·box·mask 같은 prompt를 받아 객체를 감지하고 분할하며 추적하는 통합 foundation model입니다. 짧은 text phrase나 exemplar로 지정한 open-vocabulary 개념의 모든 인스턴스를 찾고, 이미지에서는 mask·bounding box·score를, 영상에서는 객체 ID와 프레임별 mask를 출력합니다. Transformers에서는 Sam3Model·Sam3VideoModel·Sam3TrackerModel 계열과 processor를 이용해 배치 처리와 streaming inference를 구성할 수 있습니다. SA-CO benchmark에서 270K 고유 개념을 대상으로 인간 성능의 75-80%를 기록해 대규모 개방형 개념 분할 용도에 맞습니다.

핵심 포인트

  • 짧은 text phrase나 exemplar로 지정한 open-vocabulary 개념의 모든 객체 인스턴스를 한 번에 분할합니다.
  • 이미지에서는 text·box·point·mask를 조합해 mask, bounding box, confidence score를 산출합니다.
  • 영상에서는 text prompt로 일치하는 객체를 찾고 프레임 간 객체 ID와 mask를 유지하며 추적합니다.
  • Streaming inference는 미래 프레임을 볼 수 없어 중복 객체와 false positive가 늘 수 있습니다.

제한사항

  • Streaming inference에서는 미래 프레임을 활용하는 hotstart heuristics가 비활성화되어 false positive와 중복 track이 늘 수 있습니다.

벤치마크

벤치마크지표비교
SA-CO benchmarkhuman performance75-80%270K unique concepts를 포함한 benchmark에서 인간 성능의 75-80%

3.1k

LIKES

1.9M

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.