TL;DR
Vesta는 로봇이 요구하는 지역화, 내비게이션, 공간적 추론, 장기 계획 능력을 하나의 모델로 통합한 연구이다. 이 접근은 여러 전문 모델을 연결하는 복잡한 추론 스택과 그에 따른 지연 및 오류 전파 문제를 줄이는 실용적 대안으로 제시되었다. 실험에서 Vesta는 벤치마크 평균에서 기존 단일 분야 SOTA를 20포인트 이상 상회하고 실제 로봇 장기 과제에서 38.3% 성공률 개선을 보였다.
왜 중요한가
Vesta는 로봇이 요구하는 지역화, 내비게이션, 공간적 추론, 장기 계획 능력을 하나의 모델로 통합한 연구이다. 이 접근은 여러 전문 모델을 연결하는 복잡한 추론 스택과 그에 따른 지연 및 오류 전파 문제를 줄이는 실용적 대안으로 제시되었다. 실험에서 Vesta는 벤치마크 평균에서 기존 단일 분야 SOTA를 20포인트 이상 상회하고 실제 로봇 장기 과제에서 38.3% 성공률 개선을 보였다.
핵심 기여
체현형 능력 통합을 위한 단일 플래너 모델 구축
Vesta는 localization, navigation, embodied reasoning, action planning의 네 가지 핵심 능력을 하나의 SFT된 기반 모델로 통합했다. 통합 모델은 동일한 아키텍처와 훈련 예산 하에서 분야별 전문가 모델과 비교해 평균 성능 우위를 보였다. 이 결과는 데이터 혼합 비율과 메모리 디자인이 다중 능력의 공존을 가능하게 했음을 시사한다.
공간 중심 SFT 코퍼스와 비율 기반 혼합 전략
학습 데이터 혼합은 Spatial Intelligence 27.1%, Navigation 21.8%, Grounding 20.8%, General VLM 16.2%, Embodied Reasoning 9.8%, Real Robots 4.3%로 구성되었다. 저자들은 이 비율을 통해 공간적 그라운딩 우선성과 일반 VLM 능력 보존 간 균형을 유지했다. 데이터 혼합의 변경만으로도 항목별 성능에 유의미한 전이가 관찰되어 통합 학습의 핵심 설계 축이 되었다.
단순한 멀티모달 메모리 하니스와 메모리 샘플링 설계
메모리는 과거 단계의 튜플을 이미지와 텍스트로 캡처해 K개 프레임으로 제한하는 샘플링 연산자를 사용했다. 샘플링 방식은 uniform과 recency-biased 두 전략을 적용해 비교했으며 이미지-텍스트 혼합이 단독 모달리티보다 우수한 성능을 보였다. 메모리에서 첫 프레임을 항상 유지하고 전이 단계의 오버샘플링(2×)을 사용해 전이 정확도를 높였다.
실제 양팔 로봇에서의 장기 메모리 집약 태스크 개선 검증
Vesta는 실제 YAM 기반 양팔 로봇에서 Find Object, Count Fruits, Memorize Candy 세 과제를 평가받았다. Vesta 플래너는 actor-only 대비 평균 성공률을 38.3% 개선했고 Qwen3-VL 플래너 대비 25% 포인트의 향상을 보였다. 실험 설계는 에피소드 당 20 샘플을 사용했고 통계적 유의성이 4σ 이상으로 보고되었다.
핵심 아이디어 이해하기
로봇의 실제 환경 작업은 위치 정보 추정, 시점 변화에 따른 부분 관찰, 연속한 행동 단계의 기억과 계획을 동시에 요구한다는 점에서 본질적으로 복합적이다. 기존 접근은 각 능력을 분리된 전문가 모델로 해결하는 경향이었으며, 이는 모듈 간 인터페이스 비용과 오류 누적을 초래해 종합적 성능과 실시간 제어에 제약을 만들었다. 본 논문의 핵심 직관은 다양한 공간적 신호와 상이한 태스크 유형을 하나의 SFT 코퍼스에 통합하고 간결한 멀티모달 메모리 하니스를 더하면 단일 모델이 전문 모델들과 동등하거나 더 나은 성능을 달성할 수 있다는 것이다.
기술적으로 Vesta는 Qwen3-VL-8B를 출발점으로 사용해 공간적 그라운딩, 내비게이션, 체현 추론, 메모리 기반 계획을 포함하는 지도학습 샘플에 대해 SFT를 수행했다. 입력 프롬프트는 현재 관찰, 샘플된 히스토리 이미지, 텍스트 메모리 캐시, 그리고 목표 지시문을 결합하도록 설계되었다. 출력은 정지/회전/픽셀 목표와 같은 네비게이션 행동 외에도 텍스트로 된 다음 서브태스크를 생성하는 형식을 모두 지원해 플래너-액터 분리를 유지하되 플래너가 풍부한 결정을 내릴 수 있게 했다.
이 접근은 데이터 혼합 비율, 전이 단계의 오버샘플링, 그리고 이미지-텍스트 병합 메모리가 상호보완적으로 작용해 전이 학습 효과를 유도한다는 점에서 차별화된다. 특히 전이 단계의 샘플링을 1×에서 2×로 늘리면 전이 정확도와 전체 정확도에 유의미한 향상이 발생했고 이미지-텍스트 혼합 메모리가 단독 모달리티보다 전반적 성능에서 우수했다. 결과적으로 통합된 단일 모델이 각 전문 분야의 성능을 유지하거나 초과하는 능력을 획득했다는 점이 핵심 결론이다.
방법론
전체 접근은 세 가지 축으로 구성되었다. 첫 번째 축은 공간적 그라운딩을 포함한 SFT 코퍼스 설계로, 대규모의 일반 그라운딩 데이터(Objects365, COCO, LVIS)와 로봇·에고센트릭·상호작용 중심의 꼬리(tail) 데이터를 결합했다. 두 번째 축은 네비게이션을 위한 R2R-style 포맷 채택으로, 각 결정 시점에 현재 뷰와 샘플된 히스토리 프레임을 조건으로 픽셀 목표, 회전 시퀀스 또는 정지와 같은 행동을 출력하도록 학습시켰다.
세 번째 축은 장기 계획을 위한 메모리 하니스와 Chain-of-Thought 양식의 중간 생성이다. 메모리는 과거 단계의 튜플을 ⟨인덱스, 타임스탬프, 관찰, 행동, 목표⟩ 형식으로 저장하고 K개 프레임으로 제한해 프롬프트에 재주입했다. 모델은 각 서브태스크를 예측하기 전에 Observation, Progress, Reasoning, Action의 네 단계 텍스트를 생성하며, 실질적 기억에는 예측된 서브태스크만 기록한다.
훈련 설정은 전체 혼합에 대해 1 epoch를 수행했고 학습률 1e-5, weight decay 0.01을 사용했다. 대규모 분산 훈련을 위해 128 H100 GPU와 배치 사이즈 256을 사용해 모델을 SFT했다. 전이 샘플링과 메모리 모달리티에 대한 추가 ablation을 수행해 최적의 혼합 및 샘플링 설정을 결정했다.
관련 Figure

이 도식은 멀티모달 입력(멀티뷰 비디오, 언어 지시, episodic memory)과 인터랙티브 리즈닝 플로우를 연결해 플래너가 관찰을 기반으로 반복적으로 행동을 생성하는 파이프라인을 보여준다. 다이어그램은 모델이 동일한 언어 헤드로 구조화된 출력(점, 박스)과 자유형 답변을 모두 생성한다는 설계를 시각적으로 나타낸다. 이 Figure는 논문의 핵심 주장인 단일 모델로 여러 체현 능력을 통합할 수 있다는 점을 보강한다.
Vesta의 모델 개념과 네 가지 핵심 능력(localization, navigation, embodied QA, planning)을 도식화한 개요 다이어그램이다.

이 차트는 Spatial Intelligence가 27.1%로 가장 큰 비중을 차지하고 Navigation과 Grounding이 각각 21.8%와 20.8%를 차지함을 명확히 보여준다. 차트는 학습 데이터의 편향이 공간적 그라운딩 역량에 중점을 두었음을 정량적으로 확인시킨다. 이 수치는 후속 ablation에서 데이터 혼합이 성능에 미치는 영향을 해석하는 근거로 사용되었다.
SFT 데이터 혼합 비율을 도넛 차트로 시각화한 그림으로 카테고리별 샘플 비율을 나타낸다.
주요 결과
전체 벤치마크에서 Vesta는 평균적으로 동일 규모의 기존 단일 분야 최고 모델 대비 20포인트 이상 우위에 있었고, 각 범주별 최강 모델을 조합한 오라클 앙상블에 대해서도 평균 10포인트 이상 우위였다. 내비게이션 R2R-CE에서는 Vesta가 navigation specialist인 InternVLA-N1과 동등한 수준의 Success Rate와 Oracle Success를 달성했으며 SPL과 NE에서는 약간의 차이를 보였다. 실세계 로봇 작업의 경우 세 가지 메모리 집약 태스크에서 actor-only 대비 평균 성공률이 38.3% 포인트 상승했고 Qwen3-VL 플래너 대비 25% 포인트 향상이 관찰되었다.
ablation 결과는 데이터 혼합의 영향과 메모리 설계의 중요성을 수치로 보여주었다. 통합 혼합(Vesta)은 Nav-only와 Embodied-only 각각의 전문화 모델들과 성능을 비교했을 때 내비게이션에서 +1.4 SR, 임베디드 평균에서 +3.9 포인트의 긍정적 전이를 보였다. 또한 전이 단계의 오버샘플링을 2×로 설정하면 전이 정확도가 크게 개선되었고 이미지-텍스트 병합 메모리가 전체 정확도에서 최상의 결과를 도출했다.
관련 Figure

이 Figure는 모델이 시퀀스 형태의 시각 관찰을 입력으로 받아 연속적인 이동 명령을 출력하는 평가 루프를 구체적으로 보여준다. 각 행은 출발부터 목표 도달까지의 중간 뷰를 시간 순으로 정리해 네비게이션 행동이 어떻게 단계적으로 생성되는지를 시각화한다. 이 시각적 예시는 R2R-CE 평가 설정에서 모델 출력 형식(회전, 전진, stop)이 실무적으로 어떻게 적용되는지 이해하는 데 유용하다.
내비게이션 평가 예시로 지시문과 연속된 에고센트릭 프레임에서 목표 지점으로 이동하는 장면들을 배열한 그림이다.
기술 상세
아키텍처는 Qwen3-VL-8B를 기반으로 한 SFT 파이프라인을 따랐다. 입력 포맷은 현재 에고센트릭 이미지, 샘플된 과거 이미지 시퀀스, 텍스트 메모리, 그리고 자연어 목표로 구성되며 모든 구조화된 출력을 언어 헤드로 텍스트 토큰 형태로 디코딩했다. Localization 출력에서 포인팅과 박스 좌표는 텍스트 좌표 체계로 직렬화되어 동일한 디코더로 처리되었다.
네비게이션에서는 에피소드 e=(I,s0,g) 정의를 사용하고 각 결정 시점 t에 모델이 (I,Ht,ot)를 조건으로 행동 at를 출력했다. 픽셀 목표는 정규화된 좌표(u,v)∈[0,1000]^2 형태로, 회전 시퀀스는 좌우 기호로, 정지는 stop 토큰으로 표현되어 후속 로우레벨 컨트롤러에 전달되었다. 계획 문제는 비마르코프적 특성을 갖기 때문에 메모리 ℳt=Φ(ot,ℳt,g)로 근사한 상태를 사용해 긴 문맥을 압축하였다.
메모리 설계는 히스토리 ℋt에서 샘플링 연산자 𝒮t를 통해 최대 K 프레임을 선택하며 첫 프레임을 항상 보존했다. 샘플링은 uniform과 recency-biased 두 전략을 시험했으며 이미지-텍스트 혼합 메모리가 최고 성능을 보였다. 전이 샘플링 비율은 2×를 기본값으로 채택했고 이 설정은 전이 단계 정확도와 전체 정확도에서 최적의 균형을 제공했다.
관련 Figure

이 Figure는 실제 YAM 기반 양팔 로봇에서의 실험 시나리오와 각 단계에서 플래너가 요구하는 행위 유형을 보여준다. 사진들은 메모리 의존적 행동(예: 어떤 서랍을 열었는지 기억해야 하는 과제)과 단계적 조작을 포함한 장기 과제가 실제 하드웨어에서 어떻게 구성되는지를 드러낸다. 실험 결과의 로버스트성을 평가할 때 이 실물 기반 시연이 실험적 근거로 사용되었다.
실제 로봇 작업의 세 가지 과제(물체 찾기, 과일 세기, 사탕 기억)의 단계별 수행 장면을 모아둔 사진 배열이다.
한계점
논문은 실제 로봇 평가에 사용 가능한 시간 제한과 액터 모델의 한계가 결과 해석에 영향을 미친다고 명시했다. 액터의 모션 품질 또는 언어 추종 실패가 전체 실패의 주요 원인으로 확인되었으며, 따라서 플래너의 향상이 곧바로 완전한 실행 성공으로 이어지지 않을 수 있다. 또한 실험에서 일부 실험 결과는 저자 측 내부 코드로 재현되어 있는 항목이 있어 외부 재현성은 추가 자원과 코드 공개에 의존한다.
실무 활용
Vesta는 하나의 플래너 모델로 로봇 시스템에서 고수준 계획과 공간적 추론을 일괄 처리할 수 있어 복잡한 멀티모듈 추론 스택을 단순화한다. 실험 결과 실제 양팔 로봇에서 장기 메모리 의존 과제의 성공률을 크게 향상시켜 산업·가정용 로봇 업무에 적용 가능성이 입증되었다. 다만 종속된 액터의 품질에 따라 전체 시스템 성능이 좌우되므로 플래너-액터 통합 검증이 필요하다.
- 가정용 혹은 서비스 로봇에서 목표 지시 기반의 장기 작업 분할 및 단계별 지시 생성
- 물류·창고 환경에서 위치 기반 작업 순서 결정과 항목 검색을 포함한 자동화 플래닝
- 현장 보조 로봇이 사람의 자연어 지시를 받아 환경을 탐색하고 물체 조작을 수행하는 시나리오
코드 공개 여부: 미확인
키워드
용어 해설
- Supervised Fine-Tuning (SFT)
- — Supervised Fine-Tuning은 큰 사전학습 모델을 레이블이 있는 다양한 작업 샘플로 추가 학습시키는 과정이다. 입력-출력 쌍을 사용해 모델의 언어·비전 정렬과 구체적 출력 형식을 조정하며, 본 논문에서는 공간적 그라운딩과 행동 예측을 위한 SFT 데이터 혼합을 구성하는 핵심 수단으로 사용되었다. SFT 비율과 샘플링 정책이 모델의 범용성 및 특화 성능에 직접적인 영향을 미쳤다.
- Vision-Language Navigation
- — Vision-Language Navigation은 텍스트 지시문과 에지오센트릭 비전 관찰을 입력으로 받아 이동 행동을 산출하는 작업이다. 본 논문에서는 R2R-style 포맷을 사용해 픽셀 목표, 회전 시퀀스, 정지 등 세 가지 출력 형태를 학습하도록 구성하였다. 이 작업은 고수준 언어 목표를 로봇의 저수준 동작으로 변환하는 플래너 능력을 평가하는 주요 축이었다.
- Multimodal Memory Harness
- — 멀티모달 메모리 하니스는 과거 관찰 이미지와 텍스트 요약을 결합해 모델 입력에 재주입하는 간단한 메커니즘이다. 각 시간 단계에서 과거 프레임을 샘플링해 K개 내로 제한하고 텍스트 캐시로 과거 서브태스크를 유지하여 긴 시퀀스 의존성을 압축한다. 본 논문에서는 이미지·텍스트 병합이 단독 이미지나 단독 텍스트보다 장기 계획 정확도를 높이는 것으로 나타났다.
- Chain-of-Thought
- — Chain-of-Thought는 모델이 중간 추론 단계를 텍스트 형태로 생성해 복잡한 의사결정 과정을 표현하는 방법이다. 본 논문에서는 각 서브태스크 예측 전에 Observation, Progress, Reasoning, Action의 네 단계 채널을 생성해 의사결정 맥락을 보강하였다. 이 중간 단계는 최종 서브태스크를 메모리에 저장하는 데 사용되어 장기적 일관성을 지원했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.