본문으로 건너뛰기

SAM2 기반 로컬 동영상 분할 도구 SAMannot

SAM2의 동영상 마스크 전파와 블록 처리를 결합한 로컬 주석 도구 SAMannot

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

SAMannot은 Meta의 SAM2를 활용해 동영상의 객체를 픽셀 단위로 분할하고 주석화하는 로컬 오픈소스 도구이다. 사용자가 일부 프레임에 상호작용 방식으로 마스크를 지정하면 객체 정체성을 유지한 채 여러 프레임으로 자동 전파하고, 잘못된 결과는 수정·정제할 수 있다. 블록 단위 처리와 블록 간 자동 프롬프트 생성으로 CPU·GPU 메모리 부담을 낮추며, 결과를 PNG 또는 polygon 기반 YOLO label format으로 내보낸다. 동물 행동 영상 연구에 활용됐고 DAVIS와 LVOS 일부 데이터로 평가됐으며, 코드는 MIT License로 공개됐다.

실용적 조언

  • 동물 행동 영상처럼 객체가 프레임마다 이어지는 연구 데이터를 주석화할 때 SAMannot의 상호작용 마스크 입력과 자동 전파 흐름을 우선 적용할 수 있다. 전파가 어긋난 구간은 사용자가 마스크를 수정한 뒤 다시 정제하고, 긴 영상은 블록 단위로 처리해 CPU·GPU 메모리 사용량을 관리한다. 결과를 학습 파이프라인에 연결할 때는 PNG와 polygon 기반 YOLO label format 중 필요한 형식을 선택하면 된다.
  • 클라우드에 영상을 업로드하기 어려운 연구 환경에서는 SAMannot을 로컬에서 실행하는 방식을 고려할 수 있다. 도입 전에는 사용하려는 영상과 유사한 데이터에서 DAVIS·LVOS 평가 사례 및 자체 샘플을 기준으로 전파 품질을 확인해야 한다. 제한된 GPU에서는 블록 크기와 자동 프롬프트 처리 흐름을 조정하면서 메모리 사용량과 수정 빈도를 함께 점검하는 것이 적절하다.

섹션별 상세

01
동영상에서 객체별 픽셀 주석을 프레임마다 수작업으로 만들면 연구용 데이터 구축에 시간이 많이 걸린다는 문제가 출발점이다. SAMannot은 사용자가 입력한 상호작용 마스크를 SAM2로 분할한 뒤 객체 정체성을 유지하면서 여러 프레임에 자동 전파한다. 동물 행동 영상 연구에 적용했고 DAVIS와 LVOS의 일부 데이터셋에서도 평가해 연구용 Video Instance Segmentation 주석 작업에 맞춘 도구임을 뒷받침했다.
02
SAM2를 긴 동영상에 직접 적용할 때 발생하는 CPU·GPU 메모리 부담을 낮추기 위해 영상을 블록으로 나누어 처리한다. 각 블록을 효율적으로 처리하고 블록 사이에서 자동으로 프롬프트를 생성해 이전 분할 결과를 다음 처리 구간으로 연결한다. 이 구조는 영상을 한 번에 처리하기 어려운 제한된 GPU 환경에서 로컬 실행을 가능하게 하며, 클라우드 업로드 없이 연구 영상을 다룰 수 있다는 실무적 의미가 있다.
SAMannot의 화면에서 놀이기구 영상 속 여러 말 모양 객체에 색상 마스크가 표시되어 있습니다.
Screenshot화면에는 동영상 프레임과 함께 객체별로 색상이 다른 분할 마스크가 겹쳐 있고, 왼쪽 패널에는 라벨·프롬프트·전파와 관련된 작업 영역이 배치돼 있습니다. 본문에서 말한 SAM2 기반 상호작용 Video Instance Segmentation과 마스크 수정·전파 흐름이 실제 주석 인터페이스에서 어떻게 쓰이는지 시각적으로 뒷받침합니다.
SAMannot 인터페이스가 분할 마스크를 덧씌운 놀이기구 영상을 처리하는 모습입니다.
Screenshot첫 번째 이미지와 같은 장면으로, 중앙 영상 영역에서 여러 객체의 마스크가 서로 다른 색으로 구분되고 왼쪽 제어 패널에서 주석 작업을 조작하는 구성이 보입니다. 로컬 GUI에서 객체별 인스턴스를 구분하고 결과를 검수하는 사용 흐름을 보여주므로 도구의 상호작용 주석 기능과 직접 연결됩니다.
03
자동 전파만으로 끝내지 않고 사용자가 전파된 마스크를 수정하고 정제할 수 있도록 상호작용 편집 흐름을 구성했다. 최종 분할 결과는 PNG 마스크 또는 polygon 기반 YOLO label format으로 내보내므로 픽셀 마스크 보관과 학습용 라벨 변환을 함께 처리할 수 있다. SAMannot은 MIT License의 오픈소스로 공개돼 특정 클라우드 서비스에 영상을 맡기지 않는 과학 영상 주석 파이프라인에 활용할 수 있다.

용어 해설

동영상 인스턴스 분할(Video Instance Segmentation)
동영상의 각 프레임에서 객체별 픽셀 영역을 분리하고, 같은 객체에 지속적인 인스턴스 정체성을 부여하는 기술입니다. 프레임 간 마스크를 전파해 수작업을 줄이며 행동 분석과 과학 영상 주석에 활용됩니다.
마스크 전파(Mask Propagation)
한 프레임에서 만든 객체 마스크를 인접한 프레임으로 전달해 동영상 전체의 분할 결과를 확장하는 처리 방식입니다. 전파 결과를 사용자가 수정하고 다시 정제할 수 있어 프레임마다 영역을 새로 지정하는 부담을 줄입니다.
YOLO 라벨 형식(YOLO Label Format)
객체의 분할 윤곽선과 클래스 정보를 YOLO 계열 학습 파이프라인에서 사용할 수 있도록 저장하는 형식입니다. SAMannot은 PNG 마스크와 함께 polygon 형태의 YOLO 라벨을 내보낼 수 있습니다.
블록 기반 처리(Block-Based Processing)
긴 동영상을 여러 프레임 블록으로 나누어 처리하는 방식입니다. 전체 영상을 한 번에 메모리에 올리지 않고 CPU와 GPU 사용량을 관리해 제한된 GPU 환경에서도 Video Segmentation을 실행할 수 있게 합니다.

언급된 도구

SAMannot추천링크

SAM2를 이용해 동영상 인스턴스 분할과 주석 작업을 수행하는 로컬 오픈소스 도구입니다. 사용자가 마스크를 지정하면 여러 프레임으로 결과를 전파하고, 전파 결과를 수정·정제할 수 있습니다. PNG와 polygon 기반 YOLO label format으로 결과를 내보냅니다.

SAM2중립

동영상 프레임에서 객체 마스크를 생성하고 사용자의 상호작용 입력을 바탕으로 분할 결과를 전파하는 기반 모델입니다. SAMannot은 SAM2를 메모리 효율적인 블록 처리 흐름에 결합합니다. 원문에서는 Meta의 Segment Anything Model 2로 제시됩니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 01.수집 2026. 09. 02.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.