TL;DR
비디오 매팅은 대상 추적의 시간적 일관성과 픽셀 단위의 미세한 알파 추정이라는 상충되는 요구를 동시에 만족시켜야 한다. 고비용의 비디오 매팅 데이터에 의존하면 도메인 편향과 추적 강건성 저하가 발생하는데, 본 논문은 이 문제를 트래커와 매팅을 분리해 해결했다. 결과적으로 이미지로만 학습한 매팅 모듈과 고정된 VOS 트래커를 조합하여 제로샷 비디오 매팅에서 SOTA 성능과 강한 일반화를 달성했다.
왜 중요한가
비디오 매팅은 대상 추적의 시간적 일관성과 픽셀 단위의 미세한 알파 추정이라는 상충되는 요구를 동시에 만족시켜야 한다. 고비용의 비디오 매팅 데이터에 의존하면 도메인 편향과 추적 강건성 저하가 발생하는데, 본 논문은 이 문제를 트래커와 매팅을 분리해 해결했다. 결과적으로 이미지로만 학습한 매팅 모듈과 고정된 VOS 트래커를 조합하여 제로샷 비디오 매팅에서 SOTA 성능과 강한 일반화를 달성했다.
핵심 기여
트래커-투-매팅 분리 설계
SAM2Matting은 VOS 트래커를 고정한 상태로 트래커의 시간적 일관성을 보존하고, 별도의 경량 매팅 컴포넌트를 이미지 매팅 데이터로만 학습해 미세한 알파 추정 성능을 확보했다. 이 분리로 트래커의 원래 추적 강건성을 손상시키지 않으면서 매팅 모듈이 세부 구조와 반투명 영역을 전담하도록 만들었다. 세 가지 트래커 기반 변형(SAM2.1-Tiny, SAM2.1-Base+, SAM3)을 공개해 다양한 성능-속도 지점을 제공했다.
ROI Detector를 통한 매팅-중요 영역 식별
ROI Detector는 마스크, 입력 프레임, 다중 스케일 특징을 결합해 픽셀 단위 이진 분류로 매팅에 민감한 영역을 식별한다. 각 해상도별 ROI 헤드를 통해 로그잇 맵을 예측하고 계층적 합성으로 최종 ROI를 생성한 뒤 임계값을 적용해 유사 트리맵의 미지 영역으로 반영한다. 이 접근은 단순 형태학적 연산보다 얇은 구조와 반투명 영역을 더 정확히 포착해 알파 예측기의 효율을 높였다.
Progressive Alpha Predictor의 다단계 정제
Progressive Alpha Predictor는 코스-투-파인 캐스케이드로 각 중간 스케일에서 알파를 예측하고 다음 스케일에 업샘플된 결과를 입력으로 사용해 점진적으로 세부를 복원한다. 각 스케일에 대해 L1 및 Laplacian 손실로 깊은 감독을 적용하고, matte-mask consistency와 smoothness 손실을 추가해 전경의 구멍을 채우고 경계 잡음을 줄였다. 이 설계는 이미지로만 학습했음에도 비디오의 미세 구조를 충실히 재현하도록 했다.
핵심 아이디어 이해하기
문제 출발점은 비디오 매팅이 고수준의 대상 추적 능력과 저수준의 픽셀 단위 세부 복원이 동시에 필요하다는 점이다. 기존 방법은 비디오 매팅 전용 데이터에 의존해 트래커를 재학습하거나 파인튜닝하는데, 이로 인해 추적 강건성이 약화되거나 데이터 스케일 제약으로 일반화가 제한되는 문제가 발생했다. 따라서 본 논문은 추적과 매팅을 역할적으로 분리해 추적은 기존 대규모 VOS 트래커에 맡기고 알파 추정은 풍부한 이미지 매팅 데이터로 학습하는 접근을 채택했다.
해결 원리는 특수화된 두 구성요소의 협력에 있다. 먼저 VOS 트래커는 프레임별 일관된 마스크를 제공해 시간적 정합성을 확보한다. 그 다음, ROI Detector가 마스크와 이미지 특징을 융합해 매팅에 실질적으로 중요한 픽셀 집합을 고른다. 마지막으로 Progressive Alpha Predictor가 다중 스케일 캐스케이드에서 중간 예측을 연쇄적으로 정제해 최종 알파를 산출한다.
이 접근은 기존 대비 몇 가지 실질적 변화를 가능케 했다. 트래커를 고정함으로써 시간적 일관성은 트래커의 원래 성능을 유지하며, 이미지 기반 매팅 학습은 도메인 다양성이 큰 이미지 데이터의 장점을 이용해 오픈월드 일반화를 향상시켰다. 결과적으로 이미지로만 학습한 매팅 컴포넌트와 강건한 VOS 트래커의 결합이 제로샷 비디오 매팅에서 SOTA 수준의 성능과 낮은 dtSSD를 동시에 달성했다.
방법론
전체 파이프라인은 VOS 트래커, ROI Detector, Progressive Alpha Predictor로 구성된다. VOS 트래커는 프레임별 마스크 M_t를 출력하고 이를 입력으로 ROI Detector는 각 스케일 i에 대해 특징 F_{t,i}, 프레임 I_{t,i}, 마스크 M_{t,i}를 받아 스케일별 ROI 로그잇 L_{t,i}를 예측한다. 스케일별 로그잇은 업샘플과 연결(concatenation)을 거쳐 계층적 합성 네트워크 f_φ로 통합되어 최종 로그잇 L_t를 만들고, 시그모이드 후 임계값 θ로 이진 ROI ℛ_t를 얻는다.
ROI로부터 유도된 유사 트리맵은 확정 전경(1), 확정 배경(0), 미지(0.5)로 픽셀을 라벨링해 알파 추정의 공간적 제약을 제공한다. Progressive Alpha Predictor는 스케일 1에서 초기 매트를 예측하고 그 업샘플을 다음 스케일 입력으로 연결해 순차적으로 정제한다. 각 스케일의 입력 X_{t,i}는 이미지 특징, 유사 트리맵, 이미지, 그리고 이전 스케일의 업샘플된 매트로 구성되며 g_{A,i}와 f_{A,i}를 통해 최종 알파 𝒜_{t,i}를 산출한다.
학습 설계는 트래커를 동결하고 매팅 컴포넌트만 이미지 매팅 데이터로 학습하도록 구성되었다. ROI Detector는 focal loss와 smooth-L1로 최적화되고 알파 예측기는 L1과 Laplacian 손실을 각 스케일에서 깊은 감독으로 적용 받는다. 추가로 matte-mask consistency 손실로 매트 내부의 구멍을 억제하고 경계의 노이즈를 줄이는 규제가 추가되며 전체 손실은 ℒ = ℒ_ℛ + ℒ_𝒜로 합산된다.
관련 Figure

왼쪽 상단은 다양한 입력 사례에서의 미세한 헤어와 반투명 구조 복원을 보여주고 중간은 ROI 기반 분할의 효과를 시각적으로 제시한다. 하단 비교는 SAM2Matting이 기존 방법보다 더 세밀한 알파를 복원하고 시간적 일관성을 유지함을 강조한다. 이 Figure는 방법의 핵심 구성요소인 ROI Detector와 Progressive Alpha Predictor가 결과 품질에 직접적으로 기여함을 시각적으로 보강한다.
이 그림은 SAM2Matting의 전반적 파이프라인과 이미지·비디오 매팅 결과 비교를 한눈에 보여준다.
주요 결과
이미지 매팅 벤치마크에서 모든 변형이 기존 기법 대비 우수한 수치를 기록했다. 예컨대 SAM2Matting(SAM2.1-T)은 P3M-500-NP에서 MAD 3.92를 달성해 비교 대상 MAM 대비 MAD가 11.48 낮아졌다는 수치가 보고되었다. 세 가지 변형(SAM2.1-T, SAM2.1-B+, SAM3)은 P3M-500-NP, AM-2K, PPM-100 등에서 전반적으로 낮은 MAD와 MSE를 보였다.
비디오 매팅 평가에서는 제로샷 설정임에도 불구하고 V-HIM60와 VideoMatte-SD에서 기존 비디오 감독 기법들을 능가했다. 예를 들어 SAM2Matting(SAM3) 변형은 V-HIM60-Hard에서 dtSSD 및 여러 매트릭스에서 최저 또는 준최저 수치를 기록해 시간적 일관성 측면의 우위가 확인되었다. 또한 논문은 SAM2.1-Tiny 변형이 1080p 200프레임 비디오에서 40 FPS로 처리되며 5GB 미만의 GPU 메모리를 사용한다고 보고해 실시간 처리와 메모리 효율을 동시에 만족함을 보였다.
제어된 실험과 소거법(ablation)에서 ROI Detector와 progressive scaling, matte-mask consistency, smoothness loss가 개별적으로 성능 향상에 기여함이 확인되었다. 비디오 데이터로 파인튜닝한 경우에는 인도메인 성능 향상이 관찰되었지만 아웃오브도메인 일반화가 저하되어 과적합 현상이 보고되었다. 이 결과는 이미지 기반 학습과 트래커 동결이라는 설계 선택이 제로샷 일반화에 기여했음을 시사한다.
관련 Figure

여러 예시에서 SAM2Matting은 빠른 움직임과 비정형 대상에서도 경계와 반투명 영역을 더 잘 복원해 시간적 깜빡임을 줄였다. 비교 대상들은 형태학적 ROI나 마스크-기반 접근에서 간과된 얇은 구조와 부착물(예: 스키 폴, 자전거)에서 오류를 보였으나 본 방법은 ROI 기반 판단과 단계적 정제를 통해 이런 오류를 회복했다. 이 시각자료는 zero-shot 비디오 매팅에서의 일반화 우수성과 시간적 일관성 개선을 뒷받침한다.
이 그림은 다양한 비디오 프레임에서 SAM2Matting과 비교 기법들의 정성적 매팅 결과를 나열해 보여준다.
기술 상세
전체 아키텍처는 외부 VOS 트래커를 입력으로 받아 프레임 단위 마스크를 제공하는 점이 핵심 구조적 특징이다. 트래커의 출력 M_t와 다중 스케일 특징 F_{t,i} 및 이미지 I_{t,i}가 ROI Detector의 스케일별 convolutional head로 입력되어 로그잇 L_{t,i}를 생성하고, 이들을 upsampling과 concatenation으로 합쳐 f_φ가 전체 로그잇 L_t를 출력한다. 최종 ROI는 시그모이드 후 임계값 θ(논문 기본값 θ=0.65)를 적용해 결정된다.
Progressive Alpha Predictor는 각 스케일에서 입력 X_{t,i}를 g_{A,i}로 고정 차원 임베딩으로 투영한 뒤 f_{A,i}가 매트를 예측한다. 첫 스케일 i=1에서는 이전 매트가 없으므로 [F_{t,1}, T_{t,1}, I_{t,1}]로 구성하고 이후 스케일부터는 업샘플된 이전 매트 U(𝒜_{t,i-1})를 추가 입력으로 사용한다. 각 스케일 예측 𝒜_{t,i}은 σ(f_{A,i}(...))로 얻어지고 최종 스케일의 출력을 원래 해상도로 업샘플해 최종 알파 𝒜_t를 생성한다.
손실 설계는 ROI Detector에 focal loss와 smooth-L1, 알파 예측에는 L1 및 Laplacian 손실을 사용하고 스케일별로 깊은 감독을 적용해 점진적 정제를 유도한다. 추가로 matte-mask consistency loss ℒ_con은 최종 알파와 VOS 마스크 간의 분할 일관성을 강제해 전경 내부의 빈 영역을 억제한다. 구현 세부로서 세 가지 변형은 트래커를 동결하고 매팅 컴포넌트만 학습했으며 학습은 4×A6000 GPU, 배치 32, 5 epochs로 수행되었고 하이퍼파라미터는 θ=0.65, α=0.15, β=0.5, λ_1=0.3, λ_2=0.6, λ_3=1.2이다.
한계점
논문에서 명시된 주요 한계는 비디오 매팅 데이터로 추가적인 파인튜닝을 수행하면 인도메인 성능은 향상되지만 아웃오브도메인 일반화가 저하된다는 점이다. 실험에서 V-HIM2K5로 파인튜닝한 경우 V-HIM60-Hard 성능은 개선되었으나 AM-2K와 같은 비사람 대상 데이터에서는 성능이 악화되었다. 따라서 도메인 특화 데이터로의 과도한 파인튜닝은 트래커의 원래 추적 강건성을 약화시키는 부작용을 초래할 수 있다.
실무 활용
실무 관점에서 SAM2Matting은 VOS 트래커와 경량 매팅 모듈을 조합해 실시간 또는 근실시간 비디오 파이프라인에 통합될 수 있다. 모델의 세 가지 변형은 성능과 속도 요구에 맞춰 선택할 수 있으며 GitHub에 코드가 공개되어 있어 엔지니어가 재현·응용하기 용이하다. 다만 비디오 데이터로 과도한 파인튜닝을 수행하면 도메인 편향이 발생할 수 있어 배포 시 데이터 다양성에 주의가 필요하다.
- 영화 후반 작업과 같은 장시간 시퀀스 처리에서 배경 교체와 인물 마스킹에 활용될 수 있으며, 트래커 동결로 긴 시퀀스에서 안정적인 시간적 일관성을 유지한다. 실제 제작 파이프라인에서는 SAM2.1-B+ 이상 변형을 사용해 품질과 처리비용을 균형 있게 맞출 수 있다.
- 이커머스 라이브 스트리밍이나 AR 응용에서 실시간 배경 제거와 반투명 소품 처리를 위해 사용될 수 있으며, 1080p 수준에서 30~40 FPS 성능을 낼 수 있어 라이브 환경에 적합하다.
- 인터랙티브 편집 툴에서 초기 프레임 마스크, 포인트, 박스 또는 텍스트(지원되는 트래커에 한함)를 프롬프트로 사용해 사용자가 대상 지정 후 자동으로 고품질 알파를 얻는 워크플로우에 기여할 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- ROI Detector
- — 프레임별로 마스크와 이미지 특징을 결합해 매팅에 민감한 픽셀을 이진 분류로 식별하는 모듈이다. 서로 다른 해상도의 특징을 개별적인 ROI 헤드로 처리한 뒤 계층적 합성으로 최종 ROI 로그잇 맵을 생성한다. 이로써 단순한 형태학적 연산보다 세밀한 반투명·복잡 구조 영역을 정확히 골라낼 수 있다.
- Pseudo-Trimap
- — VOS 마스크의 확정 전경·배경을 고정하고 ROI를 미지 영역으로 표시해 트리맵 형식으로 변환한 입력이다. 확정 전경은 1, 확정 배경은 0, 검출된 ROI는 0.5로 표기하여 알파 예측기의 공간적 힌트로 사용된다. 이 처리로 알파 추정기가 경계와 반투명 영역에 집중하도록 유도한다.
- Progressive Alpha Predictor
- — 코스-투-파인(c coarse-to-fine) 전략으로 여러 스케일에서 중간 알파를 예측하고 다음 스케일에 업샘플된 매트를 전달하며 정제하는 모듈이다. 각 스케일에서 L1 및 Laplacian 손실로 지도학습을 하고 최종 해상도로 업샘플하여 알파 매트를 출력한다. 단계별 감독과 매트-마스크 일관성 손실로 구멍 및 거친 경계를 줄인다.
- dtSSD
- — 비디오 매팅에서 시간적 일관성을 평가하는 지표로서 프레임 간 알파 변화의 공간적·시간적 차이를 수치화한다. 값이 작을수록 프레임 간 깜빡임과 시간적 불연속이 적음을 의미한다. 논문에서는 이 지표를 통해 VOS 기반 설계가 시간적 일관성을 유지함을 보였다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.