TL;DR
SAM 2 기반 비디오 객체 추적은 비선형 모션과 교란에 취약하다. 본 연구는 Motion Predictor(MP), Error Detection–Recovery Module(EDRM), Target-Aware Memory Bank(TAMB)로 세 가지 cue를 통합해 추적의 시간적 연속성, 공간적 안정성, 시맨틱 일관성을 동시에 보장한다. 이로써 unseen 객체 및 다양한 시나리오에서 일반화 성능이 향상되고 anti-UAV 데이터셋과 같은 복잡한 비선형 모션에서도 강건성이 개선된다.
왜 중요한가
SAM 2 기반 비디오 객체 추적은 비선형 모션과 교란에 취약하다. 본 연구는 Motion Predictor(MP), Error Detection–Recovery Module(EDRM), Target-Aware Memory Bank(TAMB)로 세 가지 cue를 통합해 추적의 시간적 연속성, 공간적 안정성, 시맨틱 일관성을 동시에 보장한다. 이로써 unseen 객체 및 다양한 시나리오에서 일반화 성능이 향상되고 anti-UAV 데이터셋과 같은 복잡한 비선형 모션에서도 강건성이 개선된다.
핵심 기여
고차 마르코프 모션 예측기(MP)
과거 k 프레임의 상태를 조건으로 다음 프레임의 바운딩 박스를 예측하는 비선형 상태 전이 모델을 도입한다. training은 바운딩 박스 궤적 주석으로 이루어지며, MSE와 CIoU 손실로 지도된다. 예측 박스 BMP와 후보 박스 B(n) 간의 기하/모션 점수를 적용해 마스크 선택에 활용한다.
에러 탐지-복구 모듈(EDRM)
TP를 구성하는 최근 프레임의 geometry와 semantics를 기반으로 현재 출력과 TP 간의 AR, 면적, 의미 유사도를 비교한다. 임계치를 넘지 않으면 추적 에러로 간주하고 TP를 동결한 채 MP의 선택을 보완하는 후보를 탐색한다. 모든 프레임에서 복구 가능성을 높인다.
타겟 인식 메모리 뱅크(TAMB)
메모리 품질(IoU, 객체 가시성), 모션 안정성(S/m), 그리고 마스크 품질을 종합해 상위 k개의 메모리 프레임을 선택한다. 최근 프레임은 항상 유지하고, Nm=6의 불특정 메모리 슬롯을 관리한다. 이를 통해 장기 추적의 안정성과 재현성을 확보한다.
SAM2 기반 프레임워크에의 경량 접목
MP는 SAM 2에 플러그-인 형태로 결합되어 inference 시점에 작동한다. MP를 제외한 TAMB/EDRM은 추가 학습 없이 작동하며, 전체 latency 증가를 최소화한다.
핵심 아이디어 이해하기
출발점: SAM 2는 영상의 시맨틱 정보와 공간적 일관성을 이미 학습 기반으로 포착하지만, 비선형 모션과 여러 distractor가 있는 비디오 객체 추적에는 한계가 있다. 이 문제를 해결하기 위해 본 논문은 세 가지 보완 신호를 통합한다: 1) Motion: 과거 상태의 비선형 패턴을 포착하는 MP, 2) Geometry: bbox의 AR/면적 일치와 공간적 구조를 고려하는 점수, 3) Semantics: 타깃의 의미적 특징(semantic embedding)을 이용한 일관성 보강. MP는 과거 상태들로부터 예측 벡터를 생성하고, 후보 마스크의 선택에서 BMP와의 일치도를 측정하는 Sg, Sm과 함께 사용된다. EDRM은 TP를 기준으로 현재 출력과의 차이를 판단해 에러를 탐지하고, 필요 시 Recovery를 수행한다. TAMB는 메모리 뱅크의 프레임을 motion, IoU, obj 가시성의 가중 합으로 선별해 고품질의 참조 프레임을 유지한다. 이처럼 세 가지 신호를 SAM2의 mask-decoding 및 memory-attention에 통합해 비선형 모션에서도 안정적이고 일반화된 추적 성능을 얻는다.
방법론
전체 접근 방식: SAM2를 기반으로 MP, EDRM, TAMB를 결합하여 마스크 선택과 기억 관리에 세 가지 cue를 반영한다. MP는 과거 프레임의 상태 벡터를 입력으로 다음 프레임의 상태를 출력하는 비선형 상태 전이 함수 fθ를 통해 ŝt+1 = fθ(set, set−1, ..., set−k+1)로 예측한다. 여기서 s는 x, y, w, h, 그리고 속도 벡터 vx, vy, vw, vh를 포함하는 상태 벡터이다. 예측 결과 BMP는 M(i) 후보들 중 Sg, Sm, SIoU의 가중합에 따라 M를 결정하는 기준으로 작용한다. Sg는 AR 유사도와 Area 유사도의 가중 결합이며, Sm은 BMP와 후보 B(n)의 IoU이다. 최종 마스크 선택은 M = arg max_n [ α·SIoU(n) + S(n)g + γ·S(n)m ]. EDRM은 TP를 기준으로 AR, Area, F˜s의 코사인 유사도를 측정하고 임계치를 넘지 않는 경우 에러로 간주한다. Recovery 모드에서 TP와 N개의 후보를 모두 사용해 세 점수 모두 임계치를 넘기는 후보를 찾으면 MP의 선택을 대체한다. TAMB는 S(i)IoU, sigmoid(S(i)object), S(i)m를 활용해 후보 메모리 프레임을 평가하고, Nm = 6으로 상한을 두고 가장 좋은 5개를 선택한다. MP는 훈련 데이터 없이 바운딩 박스 궤적에 기반해 학습되며, 4-layer LSTM으로 구성되고 k = 5이다. L reg = λ1·LMSE + λ2·LCIoU로 지도되며, S˜P T P의 업데이트를 통해 TP를 구성한다. 학습 시 CIoU 손실이 바운딩 박스 정합과 중심 위치의 이동, ABI 비율의 정합성을 높인다. 구현적으로 MP는 SAM2의 추론 시점에 플러그-인 방식으로 삽입된다. 실험은 LaSOText, OTB, TrackingNet 및 Anti-UAV 데이터를 포함한다. 실험적으로 SAMOSA는 일반 VOT 벤치마크 및 anti-UAV 벤치마크에서 SAM 2 기반 방법 대비 강건성과 일반화가 향상된다.
관련 Figure

TP, geometry, semantic cues를 이용한 에러 탐지/복구 흐름과 MC의 역할을 시각적으로 제시한다. 논문의 방법론 섹션과 연결되어 있으며 anchor_key는 'methodology'.
EDRM 프레임워크 구성도

MP의 예측-마스크 선택-메모리 업데이트-에러 탐지 및 복구까지의 흐름을 시각화한다. 방법론의 구체적 구성요소를 보강한다. anchor_key는 'methodology'.
MP/EDRM/TAMB의 상호작용 흐름도
주요 결과
주요 벤치마크에서의 성능: SAMOSA는 일반-VOT 벤치마크에서 SAM2 기반 방법 중 최상위를 지속적으로 달성한다. LaSOText에서 AUC 62.97, P 74.20, Pnorm 75.96; OTB에서 AUC 71.94, P 94.26, Pnorm 86.44; TrackingNet에서 Succ 85.55, P 88.31, Pnorm 91.43으로 보고되며, latency 증가는 SAM 2.1 대비 약 +10.7 ms로 나타난다. Anti-UAV 벤치마크에서도 SAMOSA의 성능이 탁월하며, RGB Anti-UAV300에서 Acc 71.39, P 94.87, AUC 64.26, TIR Anti-UAV300에서 Acc 63.02, P 92.29, AUC 60.86, Anti-UAV410에서 Acc 60.60, P 89.63, AUC 58.12, Anti-UAV600에서 Acc 75.89, P 98.45, AUC 64.05, DUT Anti-UAV에서 Acc 69.91, P 98.45, AUC 64.05로 나타난다. 모듈별 Ablation 연구에서 MP, EDRM, TAMB를 모두 사용하는 경우가 LaSOText와 Anti-UAV RGB에서 최상위 성능을 보이며, MP는 더 복잡한 Anti-UAV 벤치마크에서 우위를 보인다. EDRM은 두 모듈이 모두 활성화되어 있을 때의 이점은 감소하지만, 하나의 모듈이 없을 때는 성능 향상을 보인다. TAMB의 구성 요소(SiIoU, Sobj, S(i)m) 모두 기여하며, 상호 보완한다. 파라미터에 대한 민감도 분석에서 α, βAR, βArea, γ 등의 변화가 성능에 큰 차이를 주지 않았다. MP의 백본 변경(KF/EKF/MLP/LSTM) 실험에서도 LSTM이 비선형 모션에 대해 더 안정적이고 예측 정확도가 높았으며, KF는 선형 가정의 한계를 보였다. 전체적으로 SAMOSA는 Latency를 크게 증가시키지 않으면서 SAM2.1 대비 '성능-효율성'의 균형을 달성한다.
관련 Figure

KF/EKF/LSTM 백본의 예측 차이를 프레임별로 시각화하여 LSTM이 비선형 모션에 더 잘 대응함을 확인시킨다. anchor_key는 'results'.
MP 백본 비교와 비선형 모션 트래젝토리 시각화
기술 상세
아키텍처: SAM2 이미지 인코더 → 메모리 어텐션 → 마스크 디코더를 기본으로, MP, EDRM, TAMB를 추가했다. MP는 과거 프레임들의 상태를 입력으로 다음 프레임의 ŝt+1를 예측하는 비선형 상태 전이 함수 fθ를 통해 제공한다. 상태 벡터 s = [x, y, w, h, vx, vy, vw, vh]이며, ŝt+1 = fθ(set, set−1, ..., set−k+1)이다. 마스크 선택 시 BMP와 후보 B(n) 간의 AR 유사도 및 면적 유사도(Sg), BMP와 후보 간의 IoU(Sm)를 결합해 최종 M*를 결정한다. TP 구성은 최근 프레임의 F˜(i) 임베딩을 mask-gated avg pooling으로 얻고, T 프레임의 평균으로 결합한다. TP의 AR/Area/S semantics 유사도에 따라 EDRM이 에러를 탐지하고 Recovery 모드에서 후보 중 완벽 매칭을 찾으면 MP의 선택을 대체한다. TAMB는 IoU, obj, 모션 등 세 가지 점수로 메모리 후보를 평가하고, Nm=6까지의 메모리를 선택한다. MP는 학습 없이 바운딩 박스 궤적으로 지도되며, 학습 손실은 Lreg = λ1·LMSE + λ2·LCIoU이다. 실험은 LaSOText, OTB, TrackingNet, Anti-UAV 벤치마크에서 수행되었고, SAM2 기반 추적기 대비 우수한 일반화성과 효율성을 보인다.
실무 활용
경량형 모듈 세트로 SAM2 기반 추적기의 성능과 일반화를 개선한다. MP가 비선형 모션에 대응하고, EDRM이 추적 실패를 감지해 복구하며, TAMB가 메모리의 품질을 높여 재참조를 안정화한다.
- 다양한 차원에서 움직임이 비선형인 비주얼 트래킹 시스템의 안정성 향상
- Anti-UAV 같은 고속/비선형 모션 대상의 실시간 추적
- RGB-T/멀티모달 환경에서 텍스트 없이도 robust한 시각 추적
- 로봇 비전에서의 지속적 기억 기반 객체 추적
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Motion Predictor
- — 본 논문에서 제안된 고차 마르코프 기반 모션 예측기로, 과거 프레임에서 추출된 위치·크기 벡터의 시퀀스를 입력으로 받아 다음 프레임의 예측 바운딩박스를 산출한다. 예측은 비선형 모션 패턴을 포착하며, mask 선택과 기억 메모리의 일관성 있는 연속성을 보장한다. 학습은 바운딩 박스 궤적 주석만으로 수행된다.
- Target Prototype
- — 최근 프레임의 안정적인 타겟 표현을 모아 구성한 벡터로, TP는 geometry와 semantic cue를 결합한 기준점 역할을 한다. EDRM의 에러 판단 및 추적 재개 시 현재 추적 상태와 TP 간의 AR(비율)·면적·코사인 유사도를 비교해 추적 품질을 평가한다. TP는 추적 도중 에러가 탐지되면 일시적으로 고정된다.
- Target-Aware Memory Bank
- — 메모리 뱅크의 메모리 선택을 타겟 정보를 기준으로 수행하는 구성요소로, Motion cue, IoU 기반 메모리 품질, Target의 가시성 정보를 결합해 상위 6개 메모리 슬롯을 선택한다. 최근 프레임은 항상 보존되며, Nm=6의 상한으로 과거 프레임을 안정적으로 재참조한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.