본문으로 건너뛰기

기초에서 응용으로: VLA 모델을 실전 환경에 맞게 개선한 LingBot-VLA 2.0

LingBot-VLA 2.0은 60,000시간 규모의 교정된 로봇·1인칭 영상 데이터, 55차원 통일 행동 표현, MoE 기반 액션 전문가와 듀얼-쿼리 증류를 결합하여 GM-100과 장기 모바일 조작에서 실환경 성능을 향상시켰다.

용어 해설

혼합 전문가(MoE)(Mixture-of-Experts (MoE))
하나의 레이어에서 여러 '전문가' 네트워크를 두고 입력 토큰마다 일부 전문가만 활성화하여 계산량을 희소하게 사용하는 구조이다. 라우터가 토큰별로 활성화할 전문가를 선택하고 출력은 선택된 전문가들의 가중합으로 형성되며 대규모 용량을 효율적으로 분배하는 데 중요하다. 이 논문에서는 액션 토큰 수준의 MoE를 action expert 내부에 도입해 표현 및 제어 능력을 확장했다.
듀얼 쿼리 증류(Dual-Query Distillation)
현재 관찰과 미래 관찰을 타깃으로 하는 두 개의 학습 가능한 쿼리를 VLA 모델에 추가하고, 각각을 깊이 추정기와 인과적 비디오 표현기에서 추출한 표상으로 지도학습하는 기법이다. 현재-미래 쌍으로 시공간적 단서를 제공하여 기하학적 인지와 인과적 시간 추론을 동시에 강화한다. 본 논문에서는 LingBot-Depth와 DINO-Video를 교사로 사용해 시간적 예측 능력을 높였다.
통일된 행동 표현(Unified Action Representation)
서로 다른 로봇 형상과 1인칭 인간 데이터에서 공통으로 사용할 수 있도록 설계한 55차원 표준 행동·상태 벡터이다. 팔 관절, 엔드이펙터, 그리퍼, 손관절, 허리, 머리, 이동 신호 등의 체파트별 필드를 포함해 패딩으로 이질적 차원을 통일한다. 이 표준화는 교차-형체(pretraining)에서 상태와 행동을 일관되게 학습하게 하여 크로스-엠바디드 일반화를 촉진한다.
1인칭 SLAM(Egocentric SLAM)
착용자 시점의 영상으로부터 프레임별 카메라 포즈를 추정하는 기술로, 손 포즈 추정 결과를 월드 좌표계로 리프팅해 연속적인 손 궤적을 재구성하는 데 사용된다. 본 논문에서는 손 궤적 재구성 단계에서 카메라 외적을 이용해 월드 좌표로 변환하고 품질 기준을 적용해 불안정한 샘플을 제거했다. 이 과정은 이기종 데이터의 표준화와 훈련시 행동 표현의 일관성 확보에 기여한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 07.수집 2026. 07. 09.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.