TL;DR
임베디드 비주얼 트래킹은 로봇이 자연어로 지시된 특정 대상을 단일 전방 카메라만으로 계속 따라가야 하는 문제로, 혼잡한 환경에서의 정확한 대상 식별과 안전한 경로 생성이 관건이다. ReferTrack은 식별을 이미지공간의 이산 선택 문제로 환원하고 역사적 bbox 정보를 명시적으로 메모리화해 식별 오류가 전체 제어로 전파되는 문제를 완화했다. 그 결과 단일 카메라 설정에서도 다중 카메라 기반 방법들과 경쟁하거나 이를 능가하는 식별 중심 성능을 달성했다.
왜 중요한가
임베디드 비주얼 트래킹은 로봇이 자연어로 지시된 특정 대상을 단일 전방 카메라만으로 계속 따라가야 하는 문제로, 혼잡한 환경에서의 정확한 대상 식별과 안전한 경로 생성이 관건이다. ReferTrack은 식별을 이미지공간의 이산 선택 문제로 환원하고 역사적 bbox 정보를 명시적으로 메모리화해 식별 오류가 전체 제어로 전파되는 문제를 완화했다. 그 결과 단일 카메라 설정에서도 다중 카메라 기반 방법들과 경쟁하거나 이를 능가하는 식별 중심 성능을 달성했다.
핵심 기여
이미지공간 인덱스 선택을 통한 지시-선택 파이프라인 재구성
ReferTrack은 언어 지시를 받은 후 현재 프레임의 후보 바운딩박스 목록에서 단일 인덱스 토큰(Refer-CoT)을 생성하도록 구성한다. 이 단일 토큰 선택은 식별을 다중선택 분류로 규정해 명시적 교차엔트로피 감독을 제공하며 LLM의 그라운딩을 이미지공간에 직접 연결한다. 결과적으로 식별 단계가 추적 행동으로 전파되기 전에 명확히 확정되어 식별 오류의 누적을 줄인다.
TVBI 토큰과 바운딩박스 큐를 통한 대상 특이적 시계열 메모리 도입
선택된 대상의 과거 bboxes를 고정 길이 FIFO 큐로 저장하고 각 과거 프레임의 TVBI 토큰에 해당 bbox 임베딩을 추가해 시각 히스토리를 조건화한다. 이 방식은 과거의 기하학적 이동 정보를 LLM 입력에 직접 삽입하여 현재 관측이 부분적일 때도 대상 위치·운동 단서를 유지한다. TVBI는 대상의 불연속 관측이나 시야 일부만 관측되는 상황에서 안정적인 후속 경로 예측을 가능하게 했다.
Refer-QA 공동학습으로 지시 기반 식별 능력 강화
ReferTrack은 SYNTH-PEDES 기반으로 합성한 1.3M 규모의 Refer-QA 샘플을 네비게이션 데이터와 1:1 비율로 공동 학습했다. Refer-QA는 인덱스 기반 카탈로그 인터페이스를 그대로 사용하므로 정적 정답 신호에서 학습한 시각-언어 정합 능력이 온라인 추적으로 전이되었다. 이 데이터 병행학습은 식별 강건성을 높여 RL 없이도 높은 성능을 확보하는 데 기여했다.
소형 4B 백본으로 달성한 강건한 단일뷰 성능 및 실세계 배포
Qwen3-4B 백본과 YOLO11+ByteTrack 검출 체인을 사용해 1.3M 네비게이션 샘플과 1.3M Refer-QA로 SFT만 수행했고 EVT-Bench의 단일뷰 설정에서 STT 89.4% 등 최상위 성능을 기록했다. 특히 식별이 난해한 DT·AT 분할에서는 다중뷰 기준 방법들과 대등하거나 우수한 결과를 보였다. 구현된 정책은 Unitree Go2와 Unitree G1에 실환경으로 배포되어 시뮬레이션에서 학습한 능력이 sim-to-real로 전이됨이 확인되었다.
핵심 아이디어 이해하기
임베디드 비주얼 트래킹 문제는 언어로 주어진 대상의 시점별 위치를 추정해 연속적인 행동을 생성하는 태스크로 요약된다. 기존 VLA 접근은 LLM 스타일의 연속적 공간 latent에서 Chain-of-Thought를 진행해 행동을 생성했는데, 이때 공간적 표현이 추상적이면 검출기 출력과의 정합이 약해 식별 오류가 발생하면 제어 모듈로 오류가 곧바로 전달되었다. ReferTrack은 식별을 이미지공간의 이산 선택 문제로 재정의해 후보 바운딩박스 중 하나를 단일 토큰으로 선택함으로써 시각-언어 정합을 명확히 하고 감독 신호를 강화한다.
방법론
ReferTrack의 전체 파이프라인은 세 부분으로 구성된다: 전방 RGB 관측을 SigLIP와 DINOv2 듀얼 인코더로 처리해 grid-pooled 토큰을 생성하고, 현재 프레임의 검출 결과를 인덱스화한 후보 카탈로그로 포맷하며, 언어·시각·카탈로그를 결합해 두 단계의 LLM 패스(Refer-CoT 생성 후 행동 생성)를 수행한다. 관찰 인코딩에서 coarse 토큰은 과거 H프레임의 요약을, fine 토큰은 현재 프레임의 세부를 담아 시퀀스를 구성하며, TVBI 토큰은 과거 프레임에 대상 bbox 임베딩을 더해 과거 기하학 정보를 삽입한다. 학습 목표는 가중합 손실 ℒ = αℒ_traj + ℒ_refer + ℒ_text로 정의되며 여기서 ℒ_traj는 예측한 연속적 웨이포인트와 전문가 웨이포인트 간의 MSE 합으로 행동 헤드를 감독하고, ℒ_refer는 Refer-CoT 토큰의 정답 인덱스를 교차엔트로피로 감독한다.
관련 Figure

이 그림은 입력으로서 전방 RGB와 검출된 bbox가 어떻게 카탈로그로 정리되는지, Refer-CoT 토큰이 어떤 방식으로 단일 후보를 선택해 이후 행동 예측을 조건화하는지 구조적으로 제시한다. 또한 선택된 bbox가 FIFO 큐로 보관되어 TVBI 토큰으로 시각 히스토리에 주입되는 파이프라인 흐름을 명확히 보여주어 본문에서 서술된 '지시-선택-추적' 분리의 작동 원리를 보강한다.
ReferTrack의 개념도와 워크플로를 보여주는 그림으로, 인덱스화된 바운딩박스 카탈로그, Refer-CoT 선택, TVBI 큐, 그리고 궤적 예측의 흐름을 시각적으로 정리하고 있다.
주요 결과
주요 벤치마크는 EVT-Bench의 단일 전방 카메라 설정에서 이루어졌고 ReferTrack은 STT에서 Success Rate 89.4%, Tracking Rate 92.5%, Collision Rate 1.6%를 기록했다. 혼잡·혼동 분할인 DT와 AT에서는 각각 73.3% SR/81.8% TR 및 74.1% SR/85.7% TR을 달성해 같은 단일뷰 계열 중 최상위 성능을 보였고, 일부 다중뷰 기준과 비교해 식별 중심 지표에서 우위를 보였다. Ablation에서는 TVBI의 유무와 Refer-CoT의 폐지 여부가 성능에 큰 영향을 미쳤고, TVBI를 완전한 GT bbox로 대체한 Oracle 실험이 SR을 81.5%로 끌어올려 식별 단계가 현재 제약임이 확인되었다.
기술 상세
전체 아키텍처는 Qwen3-4B LLM을 중심으로 시각 인코더, bbox 임베더, 후보 카탈로그 토큰화, 그리고 행동 디코더(MLP 기반 ActionHead)를 연결한 두 단계 처리 구조이다. 시각 스트림은 SigLIP와 DINOv2의 특징을 병합해 64×C의 fine 토큰과 4×C의 coarse 토큰으로 풀링하고, 이들을 MLP 기반의 vision projector로 LLM 잠재공간으로 사상한다. 후보 카탈로그의 각 항목은 식별 토큰(예: ⟨ped_k⟩)과 bbox 임베딩 E_bbox = P_bbox(b_T^{(k)})로 인코딩되어 LLM의 자동회귀 토큰 공간에서 단일 Refer-CoT 토큰 선택으로 종결된다.
관련 Figure

이 도표는 TVBI 토큰 생성 과정(정규화된 bbox→MLP 임베딩→TVI 토큰에 덧셈)과 후보 카탈로그가 어떻게 LLM 입력으로 합쳐지는지를 블록 단위로 정리한다. 또한 학습 시 참조되는 손실 구성과 큐 업데이트 흐름을 함께 보여주어 기술적 세부가 본문 수식과 어떻게 연결되는지 시각적으로 확인할 수 있다.
ReferTrack 전체 시스템과 각 모듈의 입력·출력을 도식화한 아키텍처 그림으로, TVBI 처리와 후보 카탈로그 생성부를 강조하고 있다.
한계점
논문 내 실험과 절차는 식별 단계가 주요 병목임을 명확히 지적하고 있다. Ablation에서 TVBI에 GT bbox를 직접 주입한 Oracle 변형과 비교하면 식별 오류가 성능 차이를 크게 만들었고 이는 검출·ReID 모듈 성능에 민감하다는 의미이다. 또한 현재 방법은 후보 K개를 우선순위로 잘라내는 전략과 검출기 품질에 의존하므로 매우 인구밀집·부분관측이 잦은 조건에서는 추가적인 추적·재인식 모듈이 필요할 수 있다.
실무 활용
ReferTrack의 인덱스 기반 지시 선택과 TVBI 메모리 구조는 단일 카메라 로봇 플랫폼에서 실시간으로 동작하도록 설계되어 실환경 적용 가능성이 높다. 실험에서는 Unitree Go2와 Unitree G1에서 평균 루프 주파수 10.6Hz로 동작하며 검출은 스텝당 약 12ms를 소요했다. 코드와 모델은 공개 저장소에 제공되어 실무 재현이 가능하다.
- 서비스 로봇이 군중 속에서 특정 이용자를 따라다니며 짐을 운반하는 상황에서 자연어 지시로 대상 식별과 안전한 추적을 수행하는 데 활용될 수 있다.
- 물류 환경에서 이동 로봇이 작업자 지시에 따라 특정 작업자를 지속 추적하면서 보조 작업을 지원하는 시나리오에 적용할 수 있다.
- 시각 기반 연구 플랫폼에서 식별-추적 통합 정책을 개발·평가할 때 단일 전방 카메라만으로도 성능을 비교·검증하는 벤치마크로 사용할 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- TVBI
- — 과거 시점의 대상 바운딩박스 정보를 시계열 시각 토큰과 결합하여 LLM 입력으로 삽입하는 인디케이터이다. 각 히스토리 프레임에 대해 정규화된 bbox 좌표를 MLP로 임베딩한 값을 TVI 토큰에 더해 과거 대상의 기하학적 궤적을 보존한다. 이는 목표 특이적 메모리로 작동해 후속 경로 예측 시 대상 위치·운동 단서를 제공한다.
- Refer-CoT
- — 현재 탐지된 후보 목록에서 단일 인덱스 토큰으로 목표를 선택하는 이미지공간 지시 토큰이다. LLM의 한 토큰 분류로 목표 후보 ⟨ped_k⟩ 또는 ⟨NO_EXIST⟩를 출력하여 식별 결정을 압축된 형태로 전달한다. 이 결정은 이후의 행동 토큰 생성과 역사 바운딩박스 큐 업데이트를 직접 조건화한다.
- Indexed BBox Catalog
- — 매 프레임 전방 이미지에서 검출된 보행자 바운딩박스를 인덱스화하여 LLM 입력으로 제공하는 이산 후보 집합이다. 각 항목은 식별용 토큰(예: ⟨ped_1⟩)과 bbox 임베딩으로 구성되어 LLM이 선택 작업을 수행하기 쉽도록 한다. 이 인터페이스는 식별을 다중선택 문제로 환원해 감독 신호를 명확히 한다.
- Refer-QA
- — 사람 ReID 데이터에서 합성된 대규모 지시-대상 대응 데이터로, 인덱스 기반 바운딩박스 선택을 학습하기 위해 구성된 QA형 레이블 집합이다. ReferTrack은 이 데이터로 시각-언어 정합 능력을 공동학습하여 온라인 추적에서의 지시 응답 성능을 강화한다. 네이티브 추적 데이터보다 풍부한 정적 정답 신호를 제공한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
