TL;DR
실세계 로봇 내비게이션은 기하학적 정확도와 장기 의미 이해를 동시에 요구하지만 기존 단일정책 접근법은 추론 속도와 제어 빈도의 불일치, 학습 간섭, 그리고 해석 가능성 결여로 실운용에 취약했다. ABot-N1은 의사결정(느린 시스템)과 모터 제어(빠른 시스템)를 분리하고 체인오브소트와 이미지 기반 픽셀 목표를 중간 인터페이스로 사용하여 이 문제들을 동시에 해결했다. 그 결과 도심 규모 POI 도달률과 실내외 성공률에서 유의미한 성능 향상을 기록함으로써 실환경 자율주행·서비스 로봇의 신뢰성 및 디버깅 가능성 제고에 직접적인 영향을 미친다.
왜 중요한가
실세계 로봇 내비게이션은 기하학적 정확도와 장기 의미 이해를 동시에 요구하지만 기존 단일정책 접근법은 추론 속도와 제어 빈도의 불일치, 학습 간섭, 그리고 해석 가능성 결여로 실운용에 취약했다. ABot-N1은 의사결정(느린 시스템)과 모터 제어(빠른 시스템)를 분리하고 체인오브소트와 이미지 기반 픽셀 목표를 중간 인터페이스로 사용하여 이 문제들을 동시에 해결했다. 그 결과 도심 규모 POI 도달률과 실내외 성공률에서 유의미한 성능 향상을 기록함으로써 실환경 자율주행·서비스 로봇의 신뢰성 및 디버깅 가능성 제고에 직접적인 영향을 미친다.
핵심 기여
느림-빠름 이중 시스템 아키텍처와 픽셀-목표 인터페이스
ABot-N1은 고용량의 느린 비전-언어 추론기와 저지연의 빠른 행동 전문가를 비동기적으로 결합하는 구조를 제안한다. 느린 시스템은 CoT와 두 종류의 이미지 기반 픽셀 목표(affordance pixel, target pixel)를 출력하여 의미적·공간적 지침을 생성하고, 빠른 시스템은 이 지침과 실시간 관측을 통합해 연속적 웨이포인트를 예측한다. 이 인터페이스는 다양한 목표 형식(point, object, POI, instruction, person)을 단일 시각언어 표현으로 환원시켜 제어기 일반화와 해석 가능성을 동시에 확보한다.
대규모 픽셀-그라운디드 데이터 엔진과 표준화된 샘플 레시피
연구진은 3D Gaussian Splatting 기반의 800+ 실내 장면과 22개 야외 장면을 포함한 데이터 엔진을 구축하여 총 30M의 사전학습 샘플을 생성했다. 데이터 파이프라인은 전문가 롤아웃, DAgger 변형, 객체·POI·사람 추적용 특수 샘플링, 그리고 픽셀 어노테이션과 CoT 합성을 포함하여 느린·빠른 시스템별로 13.3M 대 16.4M의 고·저수준 데이터 분배를 실현했다. 이러한 대규모의 픽셀-그라운디드 코퍼스는 장기적 의미 추론과 제어 회복 능력을 동시에 학습시키는 데 핵심 역할을 했다.
결과지향적 후훈련으로 느린 시스템을 정렬하는 GRPO 기반 레시피
느린 시스템의 CoT 및 픽셀 목표 출력을 환경 기반 보상으로 직접 최적화하기 위해 Group Relative Policy Optimization(GRPO)를 적용했다. GRPO는 출력 후보 그룹을 생성하여 그룹 내 상대적 이점을 기준으로 정책을 갱신하고, 파싱 형식 검사·타겟 정렬·안전 여유 보상으로 복합 보상 함수를 설계해 보상 분산과 보상 해킹을 제어했다. 이 후훈련 단계는 픽셀 목표의 물리적 유효성을 높이고 실제 성공률에 직접적으로 기여했다.
도시 규모 폐루프 벤치마크 공개와 SOTA 성능 달성
실세계 상업 지구와 다양한 실내외 장면을 포괄하는 ABotN-PointBench와 ABotN-POIBench를 공개하여 최종미터(final-meter) 도착 및 사회적 준수 평가를 가능하게 했다. 논문에서 제시한 단일 체크포인트는 POI 도달률을 35.0% 증가시켜 77.3%를 기록했고, 복잡한 실내 및 야외 장면에서 각각 95.4%와 92.9%의 성공률을 보고했다. 이 결과는 기존의 단일 목적 모델과 멀티태스크 모델을 능가하는 종합적 성능 우위를 보여준다.
핵심 아이디어 이해하기
전통적인 단일정책 end-to-end 내비게이션은 관측에서 곧바로 행동을 출력하므로 의미 추론의 느린 시계열과 제어의 빠른 시계열이 동일한 파라미터 공간에서 충돌하며 최적화 간섭이 발생한다. 이 구조는 지도·위치 오차가 존재하는 실제 환경에서 좌표 기반 목표가 보행 불가능한 영역으로 치우치는 등 물리적 실패로 이어지기 쉽다. 또한 내부 표현이 블랙박스화되어 실패 원인 추적과 안전성 감사가 어렵다는 근본적 한계가 있다.
방법론
ABot-N1은 이 문제를 느린 추론기와 빠른 제어기로 분리하는 방식으로 해결한다. 느린 시스템은 4B-파라미터 VLM(Qwen-3.5-4B)을 사용해 과거 관측과 현재 삼안(tri-view) 관측, 그리고 자연어 목표를 입력으로 받아 Chain-of-Thought와 픽셀 목표를 생성한다. 빠른 시스템은 2B-파라미터 VLM(Qwen-3.5-2B)을 기반으로 느린 시스템의 CoT와 픽셀 목표, 최근 관측을 융합해 QFormer 교차-어텐션과 MLP 헤드를 통해 연속적 SE(2) 웨이포인트 시퀀스(H=5)를 예측한다.
관련 Figure

이 그림은 느린-빠른 이중 시스템이 CoT와 픽셀 목표를 통해 어떻게 서로를 보완하는지 시각적으로 정리했다. 또한 하단에 제시된 여러 태스크별 성공률 바 차트는 ABot-N1의 다양한 벤치마크에서의 정량적 우위를 한눈에 확인할 수 있게 한다. 해당 도표는 시스템 구성과 성능 결과를 연결하여 방법론의 유효성을 직관적으로 보강한다.
논문의 전체 설계 개요와 주요 벤치마크 결과를 한눈에 보여주는 그림으로, 느린 시스템의 CoT·픽셀 출력과 빠른 시스템의 연속 웨이포인트 생성 흐름을 포함한다.

이미지는 30M 전처리 샘플, VLA 및 CoT 파이프라인의 역할 분담, 그리고 안전성 기준에 따른 샘플 분류(Safe/Critical/Danger)를 한데 모아 데이터 전략의 범위와 구성 요소를 명확히 드러낸다. 이 자료는 데이터 규모와 샘플링 비율이 모델 학습과 안정성 확보에 어떻게 기여하는지를 확인할 수 있는 근거로 활용된다.
대규모 데이터 엔진과 샘플 생성 파이프라인을 보여주는 그림으로, 실내·실외 장면, VLA/CoT 파이프라인, 그리고 근접 위험 샘플링을 시각화했다.

그림은 점 목표의 경우 목표 좌표가 드리프트할 때 안전한 보행 가능 지점을 어떻게 선택하고 투영하는지, 안전 검사와 역추적(backtrack) 절차를 포함한 파이프라인을 제시한다. 이 시각 자료는 point-goal 샘플의 노이즈 주입, 안전성 검증, 그리고 느린/빠른 시스템용 샘플 분리 방식을 이해하는 데 핵심적이다.
Point-goal 데이터 생성 파이프라인과 구조화된 샘플 예시를 삼안 관측과 affordance 픽셀로 보여주는 도식이다.

이미지는 긴 자연어 경로 지시를 실행 가능한 하위 지시로 분해하고 각 하위 지시와 프레임 범위를 정렬하여 CoT와 affordance/target 픽셀을 생성하는 절차를 보여준다. 이 정렬 과정은 느린 시스템의 CoT가 시간적 진행을 추적하도록 학습되는 방식과 픽셀 기반 터미널 어노테이션의 생성 원리를 뒷받침한다.
Instruction-following 데이터 파이프라인으로, 긴 지시문을 서브-인스트럭션으로 분해하고 각 구간에 픽셀 어노테이션을 정렬하는 과정이 시각화되어 있다.

그림은 MoGe-V2 기반의 기하학적 시드 생성, 이를 Qwen-3.5-4B로 증류하여 31M 스트리트뷰에서 8M 유효 샘플을 추출하는 확장 전략을 도식화한다. 이 과정은 POI의 존재/부재를 명시적으로 학습시키는 양성·음성 샘플링과 최종 접근 지점의 입체적 어노테이션을 가능하게 함을 시사한다.
POI-goal 데이터 생성 파이프라인으로 모노큘러 깊이 기반 시드, VLM 기반 대규모 어노테이터, 양성·음성 샘플 합성을 통한 8M 유효 라벨 확장을 보여준다.

이 그림은 사람이 시야에서 사라질 때를 대비해 affordance 픽셀이 미래 투영 웨이포인트로 대체되는 규칙을 포함한 추적 데이터 생성 절차를 보여준다. 이를 통해 person-following에서 메모리 기반 재획득과 OOD 상황에서의 제어 회복 능력 학습이 어떻게 구성되는지 확인할 수 있다.
Person-following 데이터 플로우와 구조화된 샘플 예시로 아바타 궤적 재생, 점유성 처리, affordance/target 픽셀 생성 과정을 보여준다.
주요 결과
논문에서 제시된 단일 통합 체크포인트는 ABotN-POIBench에서 POI 도달률을 기존 대비 35.0% 상승시켜 77.3%를 기록했고, 복잡한 실내와 야외 포인트-골 내비게이션에서 각각 95.4%와 92.9%의 성공률을 달성했다. 다섯 가지 과제(point-goal, object-goal, POI-goal, instruction-following, person-following) 전반에서 기존의 전문화된 모델과 다중태스크 모델들을 능가하는 일관된 강건성을 보였고, 특히 좌표 드리프트와 장기 의미 불확실성을 픽셀 재접지 메커니즘으로 효과적으로 완화했다.
기술 상세
아키텍처는 느린 시스템과 빠른 시스템을 비동기적으로 운용하는 데 초점을 맞추며, 느린 시스템은 Qwen-3.5-4B 기반으로 tri-view와 레퍼런스 메모리를 입력받아 자연어 CoT와 이미지상의 affordance/target 픽셀을 출력한다. 빠른 시스템은 Qwen-3.5-2B 기반으로 최근 관측, 느린 시스템의 CoT와 픽셀, 레퍼런스 관측을 인코딩한 후 QFormer-style cross-attention으로 액션 쿼리를 추출하고 MLP로 H=5 연속 SE(2) 웨이포인트(각각 x,y,sinθ,cosθ,c)를 예측한다. 학습은 느린 시스템에 대해 CoT 토큰의 교차엔트로피 손실과 픽셀 좌표 회귀를, 빠른 시스템에 대해 위치·각도에 대한 smooth-L1 손실과 도착 플래그에 대한 이진손실을 사용하며, 모달리티별로 노이즈 주입·채널 마스킹·서브옵티멀 및 OOD 보정 궤적을 포함한 강건화 데이터 스케줄을 적용했다.
관련 Figure

다이어그램은 느린 시스템이 참조 메모리, 삼안 관측, 이전 결정 등을 입력으로 받아 CoT와 픽셀 목표를 생성하고, 빠른 시스템이 이 신호들을 받아 QFormer와 MLP로 웨이포인트를 생성하는 처리 흐름을 단계적으로 보여준다. 또한 비동기적 추론과 참조 관측을 통한 시간적 일관성 유지 방식이 그림으로 보강되어 있어 기술 재현과 구현 세부사항 이해에 직접적인 도움을 준다.
느린 시스템과 빠른 시스템의 입력·출력·연동 메커니즘을 상세하게 도식화한 아키텍처 다이어그램이다.

이 그림은 고용량 시드 CoT를 소형 VLM으로 증류하고 재적용하는 데이터 플라이휠을 설명하며, A* 경로와의 일관성 검사를 통해 최종적으로 약 110K의 고품질 CoT 에피소드를 확보하는 과정을 보여준다. 해당 도식은 객체 탐색에서 CoT의 신뢰성 보장을 위한 자동화된 파이프라인 설계가 핵심임을 강조한다.
Object-goal 데이터 플로우를 나타내는 그림으로 CoT 시드, 자기-플레이, A* 기반 일관성 필터링을 통한 고품질 CoT 수집 과정을 보인다.
한계점
느린 시스템에 사용된 4B-파라미터 VLM은 높은 추론 비용을 초래하여 리소스 제약이 있는 현장 장비에서 직접 배포하기 어렵다. POI 관련 데이터는 대규모 정적 스트리트뷰 어노테이션을 통해 느린 시스템만 감독하도록 구성되었기 때문에 POI에 대해 폐루프 행동으로 직접 학습하지 못한 점이 있다. 또한 데이터 파이프라인이 고해상도 3DGS 재구성 및 정밀 보행성 어노테이션에 의존하므로 다른 센서 설정이나 낮은 품질 시각 데이터로의 도메인 이전은 추가 검증이 필요하다.
실무 활용
ABot-N1의 구조는 느린 추론기와 빠른 제어기의 분리를 통해 실제 서비스 로봇의 해석 가능성·안전성·회복성을 개선하므로 건물 내부 배송, 쇼핑몰 안내, 도심 POI 안내 같은 실무 환경에 적용 가능성이 높다. 다만 느린 시스템의 고비용 추론과 POI 데이터의 정적 어노테이션 기반 한계는 배치별 설계와 온-디바이스 최적화가 병행되어야 한다. 공개된 벤치마크와 데이터 파이프라인은 연구자·개발자가 실환경에 가까운 조건에서 알고리즘을 비교·개선하는 데 유용하다.
- 대형 쇼핑몰이나 상업 지구에서 최종미터 정확도가 필요한 상호작용형 길안내 로봇의 길찾기와 출입구 도달 임무 적용
- 사무건물, 호텔 로비 등 실내 배달 서비스에서 자연어 지시를 받아 안전한 보행 경로를 생성하고 최종 접근을 보증하는 내비게이션
- 사람 추적 기반의 동반 로봇(person-following)에서 시야 이탈 시 메모리 기반 재획득과 안전 여유를 보장하는 추적 행동 제어
코드 공개 여부: 미확인
키워드
용어 해설
- Pixel Goal
- — 이미지 평면 상의 2차원 좌표로 표현된 목표 지점으로, 느린(reasoner) 시스템이 생성하여 빠른(controller) 시스템이 시각적 앵커로 추적하도록 하는 방식이다. 이 표지는 접근 가능 지점(affordance pixel)과 실제 대상 지점(target pixel)으로 구분되어 탐색과 접근 단계를 분리한다. 내비게이션 파이프라인에서 언어적 CoT와 결합되어 다양한 목표 종류(point-goal, object-goal, POI, instruction-following, person-following)를 공통 인터페이스로 통합한다.
- Chain-of-Thought
- — 자연어 형태로 단계적 추론 근거를 출력하는 기법으로, 느린 시스템이 목표 해석과 경로 계획을 사람 가독성 있는 문장으로 생성한다. CoT는 복잡한 의미 해석과 장기적 의사결정을 분리하여 빠른 제어기에는 시각적 픽셀 앵커만 제공하게 한다. 이 과정은 추론의 명료성, 디버깅 가능성, 보상 기반 후훈련 시 표준화된 보상 설계에 기여한다.
- 3D Gaussian Splatting
- — 고해상도 장면 재구성을 위해 점군 데이터를 가우시안 혼합체로 표현하고 최적화하는 렌더링/재구성 기법이다. 본 논문에서는 시뮬레이션 및 실사 장면을 3DGS로 재구성하여 정밀한 보행 가능성 주석과 닫힌 루프 평가를 가능하게 했다. 이 기법은 대규모 실내외 장면의 광학적 일관성과 충돌 기하를 동시에 확보하는 데 중요하다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.