TL;DR
기존 VLA 모델은 시각 정보에 의존해 물리적 조작 시 미세한 힘 조절이나 미끄러짐 대응에 한계를 보였다. T-Rex는 시각 기반의 저주파 계획과 촉각 기반의 고주파 반응 경로를 분리하는 구조를 제안하여 이 문제를 해결한다. 시각과 언어 맥락을 캐싱하고 촉각 정보를 별도의 Expert로 처리함으로써 로봇은 접촉 순간의 힘 변화에 즉각적으로 반응할 수 있다. 실험 결과, T-Rex는 다양한 조작 작업에서 기존 모델 대비 월등한 성공률을 기록하며 데이터 효율성 또한 입증했다.
챕터별 상세
인트로
VLA는 Vision-Language-Action 모델의 약자로, 시각과 언어 정보를 바탕으로 로봇의 행동을 생성하는 모델이다.
T-Rex 핵심 아이디어
저주파 계획은 전체적인 조작 방향을 결정하고, 고주파 보정은 접촉 순간의 미세한 힘 변화에 즉각적으로 대응한다.
Latent Expert
Latent는 겉으로 보이는 픽셀 이미지가 아니라, 모델 내부에서 압축된 의미 표현을 뜻한다.
Action Expert
Denoising은 노이즈를 제거하여 행동을 구체화하는 과정이다.
Tactile Expert
촉각 정보는 단순히 힘의 크기뿐만 아니라, 어느 위치가 눌렸는지, 힘이 어떻게 변하는지 등 다양한 정보를 포함한다.
Asynchronous Reactive Execution
Asynchronous는 비동기라는 뜻으로, 모든 모듈이 같은 타이밍에 돌지 않는다는 의미이다.
실험 결과 분석
Ablation study는 모델의 구성 요소를 하나씩 제거하거나 바꾸었을 때 성능이 어떻게 달라지는지를 확인하는 실험이다.
아웃트로
Physical AI는 물리 세계에서 상호작용하는 AI 기술을 의미한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


