왜 중요한가
Qwen-RobotNav는 하나의 모델이 서로 다른 내비게이션 과제를 수행하도록 관찰 전략을 런타임에 재구성할 수 있게 만든다. 이 접근법은 추적처럼 최신성에 의존하는 태스크와 장기 기억이 필요한 지시 따르기를 동일한 가중치로 해결할 수 있게 한다. 결과적으로 상위 플래너가 중간에 모델의 관찰 파라미터를 바꿔 복합 행동을 조립할 수 있어 장기 목표 수행을 위한 모듈화가 가능해졌다.
관련 Figure

이 도판은 Qwen-RobotNav의 핵심 개념인 파라미터화된 인터페이스와 상위 플래너와의 연동 방식을 한눈에 보여준다. 다양한 태스크(지시 따르기, 대상 추적, 객체 탐색 등)에서 동일한 백본을 호출하되 task mode와 관찰 파라미터를 변경해 동작을 조절하는 흐름을 시각적으로 입증한다. 또한 여러 벤치마크에서 Qwen-RobotNav-4B/8B가 경쟁력 있는 성과를 낸 점을 요약해 논문의 실험 범위를 직관적으로 보강한다.
논문의 전체 개요와 주요 벤치마크 성과를 요약한 Figure로 모델 구조, 태스크 예시, 및 결과 스냅샷을 포함한다.
핵심 기여
파라미터화된 관찰 인터페이스를 통한 태스크 적응성 제공
Qwen-RobotNav는 총 토큰 예산 B, 시간 감쇠 γ, 카메라 가중치 w_c, 프레임 샘플 모드 등 관찰 제어축을 노출해 추론 시점에 관찰 전략을 재구성할 수 있게 했다. 이 인터페이스는 훈련 시 모든 파라미터를 랜덤화해 어떤 추론 구성에도 일반화하도록 설계되었다. 덕분에 상위 플래너는 동일한 모델을 호출하면서 모드 및 관찰 전략만 바꿔 다양한 서브태스크를 조합할 수 있다.
시각 토큰 할당·크기 조절 알고리즘과 자연어 시점 태깅 결합
모델은 시간·카메라별 가중치 행렬 W를 계산하고 제약 분배 알고리즘으로 각 이미지에 할당할 토큰 수를 결정한 뒤 해당 토큰 예산에 맞춰 이미지 해상도를 조정한다. 시각 토큰 앞뒤로 View/Time과 같은 자연어 태그를 삽입해 카메라 정체성과 시간 순서를 LLM이 해석하도록 만들었다. 이 설계는 아키텍처 변경 없이 다양한 플랫폼과 카메라 구성에서 동작하게 하는 데 기여한다.
Qwen3-VL 기반의 경량 액션 헤드로 궤적 회귀 통합
시각-언어 백본(Qwen3-VL) 위에 4층 MLP 액션 헤드를 두어 K=8개의 웨이포인트를 회귀하도록 설계했다. 웨이포인트는 (x,y,θ)로 정규화되어 MSE 손실로 학습되며 비주얼·언어 입력과 동일한 포워드 패스를 공유한다. 이 방식은 대다수의 공간 추론을 LLM 내부에 유지하면서 학습된 세계 지식을 경로 계획에 직접 활용하게 한다.
다중 태스크 대규모 병렬 학습과 시뮬·생성 데이터 결합
훈련 데이터는 총 15.6M 샘플로 구성되어 있으며 이 중 85%는 궤적 계획 데이터, 15%는 비전-언어 추론 데이터로 구성되었다. 시뮬레이터 기반 경로와 T2V(text-to-video) 생성 파이프라인으로 추가적인 포토리얼한 샘플을 자동 생성해 도메인 다양성을 확보했다. 비전-언어 공동 학습은 궤적 전용 학습 시 나타나는 반응적 행동 맵핑으로의 붕괴를 방지했다.
핵심 아이디어 이해하기
문제의 출발점은 내비게이션 태스크들이 서로 다른 시간적 문맥과 해상도 요구를 가진다는 점이다. 전통적 접근은 고정된 프레임 샘플링이나 슬라이딩 윈도우를 사용해 모든 태스크에 동일한 관찰 전략을 적용하기 때문에 장기 기억이 필요한 태스크에서는 정보 손실이 발생하고, 단기 반응이 중요한 태스크에서는 과거 정보가 노이즈로 작용한다. 이 논문은 관찰 전략 자체를 제어할 수 있는 파라미터 인터페이스로 문제를 재정의해 동일한 백본으로 다양한 요구를 만족시키게 했다.
방법론
전체 접근 방식은 Qwen3-VL 백본을 그대로 활용하되 관찰 인코딩 파이프라인을 파라미터화하는 것이다. 입력으로 다중 카메라의 연속 RGB 프레임과 내비게이션 지시문을 받고, 먼저 프레임 샘플링 모드(m)를 적용해 T' ≤ T개의 프레임을 선택한다. 선택된 프레임에 대해 시간 가중치 ω_t = exp(γ t/(T'−1))를 계산하고 카메라별 중요도 w_c를 곱해 가중치 행렬 W를 얻은 뒤 제약 분배(ConstrainedAlloc)로 각 셀에 최소·최대 범위를 지키며 토큰 예산 B를 분배한다.
관련 Figure

그림은 γ 값 변화가 시간 가중치 ω_t에 어떤 기울기를 만들어 최근 프레임에 대한 예산 몰림을 유도하는지 수치적으로 나타낸다. 세 가지 예산 수준(B=1024,3072,4096)에 대한 할당 행렬을 통해 낮은 예산에서는 어떤 시점·카메라가 우선되는지, 풍부한 예산에서는 어떻게 포화가 발생하는지 가시적으로 확인할 수 있다. 이 자료는 논문의 핵심 설계 선택인 경험적 분배 알고리즘의 동작을 정량적으로 보강한다.
시간 가중치 분포와 시점별 토큰 예산, 예시 토큰 할당 행렬을 시각화한 Figure로 γ와 B가 할당에 미치는 영향을 보여준다.

이 다이어그램은 플래너가 서브골, task mode, 관찰 구성 Φ를 생성해 Qwen-RobotNav에 전달하고 결과 롤아웃을 증거 레코드로 압축해 노트북에 저장하는 전체 루프를 도식화한다. 에비던스 노트북과 키프레임 참조 메커니즘이 장기 기억과 증거 재호출을 어떻게 지원하는지 명확히 드러난다. 에이전틱 시스템 설계에서 플래너와 실행자(Executor)의 역할 분리가 실제로 어떻게 운영되는지 보여준다.
상위 플래너가 Qwen-RobotNav를 호출하고 시각 도구들과 증거-노트북을 통해 장기 추론을 수행하는 에이전틱 네비게이션 흐름을 보여주는 다이어그램이다.

토폴로지 기반의 스켈레톤화, 팽창·침식, 스켈레톤 트리버설과 백트래킹으로 현실적인 탐색 행동을 합성하는 과정을 시각적으로 제시한다. 이 파이프라인은 객체 탐색 데이터 생성이 단순 최단경로 대신 탐색·백트래킹 행동을 포함하도록 설계되었음을 증명해 객체 탐색 학습의 현실성을 높인 점을 보강한다. 생성된 경로는 이후 VLM 기반 목표 주석 단계로 이어져 개방어휘 목표를 확보한다.
스켈레톤 기반 탐색 경로 생성과 BEV(top-down) 맵 전처리 과정을 단계별로 보여주는 도해이다.
주요 결과
Qwen-RobotNav는 대규모 다중 태스크 테스트에서 우수한 성능을 보였다. VLN-CE RxR Val-Unseen에서 Qwen-RobotNav-8B는 76.5% SR을 달성했고 EVT-Bench 추적에서는 90.0% TR을 기록했으며 NAVSIM에서는 91.4 PDMS를 획득했다. 에이전틱 시스템과 결합한 경우 HM-EQA 및 EXPRESS-Bench에서 기존 대비 각각 10.8%와 15.4%의 성능 향상을 기록했고 네비게이션 스텝 수를 77% 절감한 결과도 보고되었다.
관련 Figure

이 차트는 VLN-CE, MP3D/HM3D ObjectNav, EVT 추적, EQA 계열 등 여러 벤치마크에서 4B 및 8B 모델의 점수를 비교해 우수성을 수치로 입증한다. 각 서브플롯은 특정 태스크군에서의 성공률, 정확도, PDMS 등 지표를 병렬적으로 제공해 멀티태스크 성능의 균형을 평가할 수 있게 한다. 실험 결과들이 논문의 주장(다중 태스크 일반화, 스케일 업에 따른 성능 향상)을 뒷받침한다.
다양한 벤치마크별 성능 바 차트로 Qwen-RobotNav의 정량적 성과를 비교해 보여준다.
기술 상세
전체 아키텍처는 세 부분으로 구성된다: SigLIP-2 기반 Vision Transformer 비전 인코더, Qwen3-VL 언어·비전 백본, 그리고 4층 MLP 액션 헤드이다. 비전 인코더는 2D-RoPE를 통해 동적 해상도 지원을 제공하고 patch merger로 인접 토큰을 병합해 LLM 차원에 정렬한다. DeepStack 메커니즘을 통해 ViT의 다중 레이어 토큰을 초기 LLM 레이어에 주입해 저수준과 고수준 시각 정보가 동시에 활용된다.
관련 Figure

이 다이어그램은 입력으로 들어오는 다중 보기 RGB, 임베디드 프롬프트, 네비게이션 지시문이 어떻게 토큰 할당과 인터리브 과정을 거쳐 Qwen3-VL로 전달되는지를 단계별로 나타낸다. 특히 Task-Adaptive Observation Encoding 블록과 Qwen3-VL의 역할 분배가 명확히 드러나며 액션 예측을 위한 경량 MLP 헤드의 위치를 표준화된 파이프라인 문맥에서 확인할 수 있다. 구조적 세부는 기술적 재현과 엔지니어링 구현에 직접적으로 유용하다.
시스템 도해로 상위 플래너와 Qwen-RobotNav의 상호작용, 입력 파이프라인, 모델 아키텍처, 그리고 액션 헤드 구성을 보여준다.
한계점
논문은 토큰 할당 알고리즘을 경험적 휴리스틱으로 명시하고 있으며 보다 이론적·최적화된 분배 전략이 개선 여지가 있음을 인정했다. 훈련에 사용한 범위(B ∈ [2048,4096], γ ∈ [1,3] 등) 외부로는 완전한 보장이 없으며 완전한 외삽 성능은 제한적일 수 있음을 보고했다. 또한 대규모 파인튜닝에 필요한 계산 자원이 크며 8B 모델의 경우 2,816 H100 GPU 시간 같은 상당한 인프라가 필요하다.
실무 활용
Qwen-RobotNav는 상위 플래너가 런타임에 관찰 파라미터를 바꿔 다양한 서브태스크를 수행하도록 설계되어 실제 에이전틱 시스템에 곧바로 통합 가능하다. 이미 공개된 GitHub 저장소가 있어 연구·엔지니어링 팀이 코드와 훈련 파이프라인을 확인할 수 있다. 클라우드와 엣지 양쪽 배포를 검토해 원격 서버 기준 평균 대기시간과 온디바이스의 안정성 트레이드오프를 제시했다.
- 장기 목표를 분해하는 상위 LLM 플래너가 서브골별로 TaskMode와 관찰 구성(예: B, γ, m)을 선택해 복합 탐색과 검증을 수행하는 에이전틱 내비게이션 시스템 통합.
- 실내 서비스 로봇에서 ObjNav 모드로 넓은 역사 커버리지를 사용해 탐색을 수행한 뒤 후보 관찰이 발견되면 Tracking 모드로 전환해 정밀 추적을 수행하는 동적 모드 전환 워크플로.
- 자율 주행과 실내 로봇을 모두 포함하는 교차 플랫폼 학습 설정에서 동일한 백본을 사용하되 자연어 임베디드 프롬프트로 embodiment를 전환해 적응적 경로 예측을 수행하는 멀티-엠보디먼트 배포.
코드 공개 여부: 공개
코드 저장소 보기키워드
추가 이미지 분석

이 그림은 instruction following, autonomous driving, point navigation 등 태스크별 샘플 수와 전체 데이터 구성비를 수치로 제시한다. 데이터 스케일과 구성은 공동 학습이 어떻게 다양한 능력을 키우는지 근거를 제공하며 특히 85% 궤적 대 15% 비전-언어 비율의 설계 의도를 뒷받침한다. 연구 재현성과 데이터 샘플링 전략 분석에 유용한 근거를 제공한다.
학습 데이터 분포를 가로 막대 및 파이 차트로 나타낸 Figure로 총 15.6M 샘플의 태스크 카테고리 비중을 시각화하고 있다.

T2V로 생성된 비디오를 VLM으로 품질 필터링한 뒤 monocular depth-and-pose 추정으로 2D 궤적을 회수하고 운동학 필터로 비현실적 샘플을 제거하는 절차가 도식화되어 있다. 이 파이프라인은 시뮬레이터 의존도를 낮추고 다양한 포토리얼 샘플을 확보해 도메인 갭을 줄이는 역할을 한다. 결과 데이터는 시뮬레이터만으로는 얻기 어려운 시각 다양성을 훈련 corpus에 추가하는 근거가 된다.
시뮬레이터 정제와 T2V 기반 자동 생성 파이프라인을 보여주며 비디오 생성에서 궤적 추출까지의 단계가 요약되어 있다.
용어 해설
- 토큰 예산(Token Budget)
- — 입력으로 LLM에 전달되는 시각 토큰의 총량을 의미한다. 이 논문에서는 B로 표기하며 각 카메라와 시점에 할당되는 픽셀 해상도와 직접 연결되어 관찰 해상도와 문맥 길이를 제어한다. 토큰 예산을 조정하면 장기 기억형 태스크에서 역사 커버리지를 넓히거나 추적형 태스크에서 최신 프레임에 집중하도록 관찰 전략을 전환할 수 있다.
- 시간 감쇠(Temporal Decay)
- — 과거 프레임에 부여하는 가중치의 기하급수적 증가를 제어하는 파라미터 γ를 가리킨다. γ 값이 클수록 최근 프레임에 더 많은 토큰을 배분해 최신 정보에 편중된 인코딩이 생성된다. 이 메커니즘은 추적처럼 최신성이 중요한 태스크와 장기 기억이 필요한 태스크를 동일한 모델에서 전환 가능하게 만든다.
- DeepStack
- — Vision Transformer의 여러 계층에서 추출된 시각 토큰을 초기 LLM 레이어로 주입하는 메커니즘을 의미한다. 이 방식은 다층의 시각 표현을 LLM의 언어적 추론 경로와 조기 결합해 공간적·저수준 시각 정보를 보존한다. Qwen-RobotNav에서는 공간적 추론과 경로 계획을 보다 정확하게 수행하기 위해 사용된다.
- 에비던스 노트북(Evidence Notebook)
- — 상위 플래너가 장기 과제에서 누적하는 요약적 메모리 저장소이다. 각 내역은 탐색한 영역, 후보 물체 위치, 기각된 가설 등 텍스트 기반의 영구적 결론을 담아 후속 계획에 활용된다. 이 구조는 전체 관찰 스트림을 플래너 컨텍스트에 직접 재주입하지 않고도 장기 추론을 가능하게 한다.
- 궤적→증거 인터페이스(Trajectory-to-Evidence)
- — 실행된 내비게이션 롤아웃을 소스 인덱스된 핵심 프레임과 텍스트 요약으로 압축하는 변환 프로세스이다. 이 인터페이스는 서브골, 구성 정보, 진행상황, 관찰된 주요 객체 목록과 같은 구조화된 레코드를 생성해 플래너가 다음 결정을 내릴 때 참조하도록 만든다. 원시 비주얼 스트림을 그대로 저장하는 대신 필요한 시점에만 키 프레임을 재호출하도록 설계된다.
코드 예제
Algorithm 1 Task-Adaptive Observation Encoding
1: Observations I_{1:T}^{1:N}, instruction L, config Φ=(B,γ,{w_c},m,b_min,b_max)
2: Token sequence fed to the LLM backbone
3: I' ← SampleFrames(I_{1:T}^{1:N}, m, T') ⊳ T' ≤ T
4: ω_t ← exp(γ ⋅ t / (T' − 1)), t = 0, …, T' − 1
5: W[t,c] ← ω_t ⋅ w_c for all (t,c)
6: A ← ConstrainedAlloc(W, B, b_min, b_max)
7: for each frame (t,c) do
8: Ĩ'_{t,c} ← Resize(I'_{t,c}, A[t,c] × (p ⋅ s_m)^2)
9: end for
10: V ← VisionEncode(Ĩ') ⊳ ViT + patch merger
11: S ← Interleave(V, viewpoint/temporal tags)
12: return Concat(S, Tokenize(L))
function ConstrainedAlloc(W, B, b_min, b_max)
A ← b_min ⋅ 1_{T'×N}; U ← all cells
repeat
Distribute B − sum(A) to U proportionally to W
Clamp cells exceeding b_max; remove from U
until no cell exceeds b_max
return A
end function이 의사코드는 관찰 프레임을 샘플링하고 시간·카메라 가중치에 따라 토큰을 할당해 시각 입력을 LLM에 직렬화하는 전체 파이프라인을 단계별로 보여준다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
