용어 해설
- 혼합 전문가(MoE)(Mixture-of-Experts (MoE))
- — 하나의 레이어에서 여러 '전문가' 네트워크를 두고 입력 토큰마다 일부 전문가만 활성화하여 계산량을 희소하게 사용하는 구조이다. 라우터가 토큰별로 활성화할 전문가를 선택하고 출력은 선택된 전문가들의 가중합으로 형성되며 대규모 용량을 효율적으로 분배하는 데 중요하다. 이 논문에서는 액션 토큰 수준의 MoE를 action expert 내부에 도입해 표현 및 제어 능력을 확장했다.
- 듀얼 쿼리 증류(Dual-Query Distillation)
- — 현재 관찰과 미래 관찰을 타깃으로 하는 두 개의 학습 가능한 쿼리를 VLA 모델에 추가하고, 각각을 깊이 추정기와 인과적 비디오 표현기에서 추출한 표상으로 지도학습하는 기법이다. 현재-미래 쌍으로 시공간적 단서를 제공하여 기하학적 인지와 인과적 시간 추론을 동시에 강화한다. 본 논문에서는 LingBot-Depth와 DINO-Video를 교사로 사용해 시간적 예측 능력을 높였다.
- 통일된 행동 표현(Unified Action Representation)
- — 서로 다른 로봇 형상과 1인칭 인간 데이터에서 공통으로 사용할 수 있도록 설계한 55차원 표준 행동·상태 벡터이다. 팔 관절, 엔드이펙터, 그리퍼, 손관절, 허리, 머리, 이동 신호 등의 체파트별 필드를 포함해 패딩으로 이질적 차원을 통일한다. 이 표준화는 교차-형체(pretraining)에서 상태와 행동을 일관되게 학습하게 하여 크로스-엠바디드 일반화를 촉진한다.
- 1인칭 SLAM(Egocentric SLAM)
- — 착용자 시점의 영상으로부터 프레임별 카메라 포즈를 추정하는 기술로, 손 포즈 추정 결과를 월드 좌표계로 리프팅해 연속적인 손 궤적을 재구성하는 데 사용된다. 본 논문에서는 손 궤적 재구성 단계에서 카메라 외적을 이용해 월드 좌표로 변환하고 품질 기준을 적용해 불안정한 샘플을 제거했다. 이 과정은 이기종 데이터의 표준화와 훈련시 행동 표현의 일관성 확보에 기여한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.






