본문으로 건너뛰기

T-Rex: 촉각 반응형 로봇 조작 기술 분석

시각 계획과 촉각 반응을 분리하여 로봇의 정교한 조작 능력을 향상시킨 T-Rex 모델의 구조와 실험 결과를 분석합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

기존 VLA 모델은 시각 정보에 의존해 물리적 조작 시 미세한 힘 조절이나 미끄러짐 대응에 한계를 보였다. T-Rex는 시각 기반의 저주파 계획과 촉각 기반의 고주파 반응 경로를 분리하는 구조를 제안하여 이 문제를 해결한다. 시각과 언어 맥락을 캐싱하고 촉각 정보를 별도의 Expert로 처리함으로써 로봇은 접촉 순간의 힘 변화에 즉각적으로 반응할 수 있다. 실험 결과, T-Rex는 다양한 조작 작업에서 기존 모델 대비 월등한 성공률을 기록하며 데이터 효율성 또한 입증했다.

챕터별 상세

00:00

인트로

VLA 모델이 물리 세계에서 물체를 다룰 때 단순히 시각 정보만으로는 한계가 있음을 지적한다. 얇은 카드를 슬롯에 끼우거나 열쇠를 돌리는 등 미세한 힘 조절과 촉각 정보가 필요한 작업에서 기존 모델의 부족함을 설명한다. 이를 해결하기 위해 촉각 반응형 로봇 조작 연구인 T-Rex를 소개한다.

VLA는 Vision-Language-Action 모델의 약자로, 시각과 언어 정보를 바탕으로 로봇의 행동을 생성하는 모델이다.

01:51

T-Rex 핵심 아이디어

로봇이 무엇을 해야 하는지는 시각과 언어를 기반으로 비교적 느리게 계획하고, 실제 접촉이 일어난 뒤에는 촉각 정보를 이용해서 훨씬 빠르게 행동을 미세 조정하는 구조이다. 시각, 언어, 행동, 촉각을 모두 하나의 모델 안에서 다루되, 이 정보들이 실제 로봇 제어에서 요구하는 시간 스케일이 서로 다르다는 문제를 해결한다. 저주파 시각-운동 계획과 고주파 촉각 보정의 분리를 통해 정교한 조작을 수행한다.

저주파 계획은 전체적인 조작 방향을 결정하고, 고주파 보정은 접촉 순간의 미세한 힘 변화에 즉각적으로 대응한다.

03:26

Latent Expert

Latent Expert는 미래의 시각 표현을 예측하는 역할을 한다. 지금 이 장면과 명령을 보면, 잠시 뒤 시각적으로 어떤 상태가 되어야 하는가를 예측한다. 모델이 지금의 행동이 미래 장면 변화와 맞아떨어지도록 학습하는 future latent alignment를 수행한다.

Latent는 겉으로 보이는 픽셀 이미지가 아니라, 모델 내부에서 압축된 의미 표현을 뜻한다.

04:08

Action Expert

Action Expert는 저주파 행동 복원 과정을 담당한다. 처음에 무작위 노이즈에 가까운 행동 후보에서 출발하여, 점차 실제 실행 가능한 행동으로 다듬어가는 denoising 과정을 수행한다. 약 5Hz로 동작하며, 전체적인 조작 방향을 정하는 데 충분한 행동 계획을 만든다.

Denoising은 노이즈를 제거하여 행동을 구체화하는 과정이다.

05:01

Tactile Expert

Tactile Expert는 고주파 행동 보정을 담당하며 T-Rex에서 가장 중요하다. 약 20Hz로 동작하며, 접촉 순간의 미세한 힘 변화나 미끄러짐에 즉각적으로 반응한다. Spatial-Temporal Tactile Encoder를 통해 촉각 정보를 모델이 이해할 수 있는 토큰으로 변환하여 사용한다.

촉각 정보는 단순히 힘의 크기뿐만 아니라, 어느 위치가 눌렸는지, 힘이 어떻게 변하는지 등 다양한 정보를 포함한다.

12:36

Asynchronous Reactive Execution

Asynchronous Reactive Execution은 느린 시각 계획과 빠른 촉각 반응을 분리하는 구조이다. Action Expert는 초록색 선으로 표시되어 약 5Hz로 천천히 실행되고, Tactile Expert는 보라색 선으로 표시되어 더 촘촘한 간격으로 실행된다. 시각 기반 계획은 한 번 세워두고, 촉각 기반 보정은 그 사이사이에 여러 번 들어가면서 행동을 계속 수정한다.

Asynchronous는 비동기라는 뜻으로, 모든 모듈이 같은 타이밍에 돌지 않는다는 의미이다.

17:58

실험 결과 분석

Table 1과 2를 통해 T-Rex의 성능을 검증한다. T-Rex는 12개의 촉각 반응형 조작 작업에서 기존 모델 대비 월등한 성공률을 기록했다. 특히 촉각 정보를 제거했을 때 성능이 크게 감소하는 것을 확인하여 촉각의 중요성을 입증했다. 또한, 비동기 촉각 보정 구조가 성능 향상에 기여함을 확인했다.

Ablation study는 모델의 구성 요소를 하나씩 제거하거나 바꾸었을 때 성능이 어떻게 달라지는지를 확인하는 실험이다.

24:11

아웃트로

T-Rex 연구를 통해 촉각을 VLA에 넣는 것이 단순히 센서를 하나 더 추가하는 것으로 끝나는 문제가 아님을 확인했다. 시각 기반 계획과 촉각 기반 즉각 반응을 분리하는 구조의 중요성을 강조한다. 앞으로 로봇 파운데이션 모델이 발전하면서 촉각과 같은 물리 감각을 모델 안에 어떻게 결합할 것인가에 대한 다양한 아키텍처가 나올 것으로 전망한다.

Physical AI는 물리 세계에서 상호작용하는 AI 기술을 의미한다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 20.수집 2026. 07. 20.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.