본문으로 건너뛰기

2D 픽셀 선택으로 장거리 로봇 내비게이션 정렬

TAMP-Nav는 2D 픽셀을 3D waypoint로 바꾸고 핵심 지점에서만 추론해 R2R-CE 66.2% SR을 기록했습니다.

용어 해설

Pixel-to-3D 행동 표현(Pixel-to-3D Action Formulation)
VLM이 3차원 이동 좌표를 직접 회귀하지 않고 현재 시야의 2D 픽셀을 선택하면, 깊이 맵과 카메라 내부 파라미터로 해당 픽셀을 3D 점으로 변환하는 방식입니다. 이렇게 얻은 waypoint를 SLAM controller가 실행해 2D 시각 사전학습과 실제 이동을 연결합니다.
Anchor-Trajectory Memory
긴 이동 기록을 모든 시각 특징으로 저장하지 않고, CoT가 실행된 핵심 노드는 시각·상태·좌표와 함께 보존하며 나머지 구간은 Space-Time Indicator로 압축하는 메모리 구조입니다. 핵심 장면의 의미 정보와 경로의 시공간 연결성을 함께 유지하는 데 목적이 있습니다.
Space-Time Indicator
위치 x·y, 시간 t, 방향 yaw를 Rotary Position Embedding과 MLP로 결합해 하나의 토큰으로 만드는 표현입니다. 방향은 sin(yaw)와 cos(yaw)로 바꾸어 0도와 360도 경계의 불연속을 피하며, 긴 경로에서 이동 순서와 기하 정보를 압축해 보존합니다.
Group Relative Policy Optimization
여러 후보 행동과 완성된 궤적을 그룹 단위로 비교해 정책을 갱신하는 강화학습 방법입니다. TAMP-Nav는 궤적 전체의 성공·효율 보상과 각 단계의 접근·충돌 회피·정지·추론·형식 보상을 각각 표준화한 뒤 합쳐, 장기 목표와 순간 행동을 동시에 학습시킵니다.
선택적 추론(Selective Reasoning)
모델이 모든 이동 단계에서 Chain-of-Thought를 생성하지 않고, 교차로·문·목표물 주변처럼 중요한 위상 노드에서만 깊은 추론을 실행하는 방식입니다. 시각 변화와 명령어 관련도를 이용해 후보 노드를 고르고, 불필요한 구간의 추론 호출을 줄여 성능과 추론 지연 사이의 균형을 맞춥니다.
Pixel-to-3D 투영(Pixel-to-3D Projection)
선택한 이미지 픽셀의 깊이값과 카메라 내부 행렬을 이용해 화면 좌표를 국소 3D 좌표로 변환하는 계산입니다. 변환된 점은 세계 좌표계로 옮겨진 뒤 저수준 SLAM controller의 이동 목표가 되며, 시뮬레이션에서는 실제 깊이 맵을 사용하고 실환경에서는 깊이 카메라를 사용합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 18.수집 2026. 08. 20.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.