본문으로 건너뛰기

pixel-to-3d-action-formulation

Pixel-to-3D 행동 표현

VLM이 3차원 이동 좌표를 직접 회귀하지 않고 현재 시야의 2D 픽셀을 선택하면, 깊이 맵과 카메라 내부 파라미터로 해당 픽셀을 3D 점으로 변환하는 방식입니다. 이렇게 얻은 waypoint를 SLAM controller가 실행해 2D 시각 사전학습과 실제 이동을 연결합니다.