TL;DR
로봇 정책은 짧은 히스토리만을 조건으로 삼아 장기 과제에서 단계 혼동과 부분 관찰로 인한 실패가 잦았다. RoboTTT는 추론 시에도 업데이트되는 빠른 가중치를 통해 긴 시간 축의 문맥을 파라미터 공간에 압축함으로써 메모리나 추론 지연을 늘리지 않고도 장기 의사결정을 가능하게 했다. 이로 인해 한 번의 인간 시연으로 작업을 모방하거나 배포 중 스스로 성능을 개선하는 등 기존 단기 컨텍스트 모델에서 불가능했던 실시간 적응 능력이 확보되었다.
왜 중요한가
로봇 정책은 짧은 히스토리만을 조건으로 삼아 장기 과제에서 단계 혼동과 부분 관찰로 인한 실패가 잦았다. RoboTTT는 추론 시에도 업데이트되는 빠른 가중치를 통해 긴 시간 축의 문맥을 파라미터 공간에 압축함으로써 메모리나 추론 지연을 늘리지 않고도 장기 의사결정을 가능하게 했다. 이로 인해 한 번의 인간 시연으로 작업을 모방하거나 배포 중 스스로 성능을 개선하는 등 기존 단기 컨텍스트 모델에서 불가능했던 실시간 적응 능력이 확보되었다.
핵심 기여
컨텍스트 길이를 8K 타임스텝으로 확장한 로봇 정책 구조
RoboTTT는 VLA(vision-language-action) 기반 정책에 Test‑Time Training 레이어를 통합해 빠른 가중치로 긴 시퀀스 문맥을 저장하도록 구성했으며, 이 구조는 추론 지연을 문맥 길이에 무관하게 일정하게 유지하면서 최대 8K 타임스텝의 문맥을 활용할 수 있게 했다.
빠른 가중치와 flow-matching 기반의 시퀀스 학습 레시피
학습 중 fast weight 초기화와 투입-갱신 동작을 외부 손실로 메타학습하고, 각 액션 청크별로 독립된 노이즈를 샘플링하는 sequence action forcing과 TBPTT를 조합해 긴 컨텍스트 학습을 메모리 제약 내에서 안정적으로 수행했다.
DAgger Distillation을 통한 온더플라이 정책 개선
수집된 DAgger 트레이젝토리에서 로봇의 실패 행동을 문맥으로 사용하고 인간 보정만을 손실로 삼아 빠른 가중치에 실패→보정 매핑을 증류함으로써 테스트 시 온라인 복구와 자체 개선 능력이 유의하게 향상되었다.
장기 컨텍스트가 닫힌 루프 성능을 꾸준히 향상시킨다는 실증
사전학습 컨텍스트 길이를 128에서 8K로 확장한 실험에서 RoboTTT는 사전학습 컨텍스트가 커질수록 과제 완수 점수가 지속적으로 상승하는 스케일링 경향을 보였고, 8K 사전학습이 1K 대비 큰 성능 이득을 가져오는 것을 확인했다.
핵심 아이디어 이해하기
로봇 시퀀스 모델은 연속된 관찰과 행동의 히스토리를 조건으로 정책을 생성해야 하지만, 모든 이전 키-값 쌍을 보관하고 매 스텝 어텐션을 수행하는 풀 어텐션 방식은 메모리와 연산이 시퀀스 길이에 따라 급격히 증가한다. 따라서 긴 시퀀스에서 실시간 제어를 유지하려면 문맥을 더 압축된 형태로 저장하면서 필요한 정보를 검색할 수 있는 메커니즘이 필요하다. RoboTTT는 이 문제에 대해 빠른 가중치라는 대체적 순환 상태를 도입해 문맥을 파라미터 공간에 순차적으로 학습시키고, 이후 쿼리에서 이 파라미터를 통해 관련 정보를 꺼내 쓰도록 설계했다.
방법론
RoboTTT의 전체 구조는 VLM(vision-language model) 백본과 DiT(Diffusion Transformer) 액션 헤드에 각 레이어마다 TTT 블록을 삽입하는 형태이다. 각 타임스텝에서 타임스텝별로 생성된 register 토큰과 상태·액션 토큰은 먼저 per-timestep attention을 통해 처리된 뒤 시간축으로 연결되어 TTT 레이어가 fast weight를 갱신하고 적용한다. 학습에서는 내부 fast-weight 손실(L_FW)을 통해 키-값 연관을 학습시키고 외부 flow-matching 손실로 액션 복원을 목표로 하며 W0(초기 fast weights)와 투사 행렬들을 외부 손실의 그래디언트를 통해 메타학습한다.
주요 결과
세 가지 실세계 장기 조립 과제(Pup Go Car, Circuit, Gear Bot)에서 RoboTTT는 평균 과제 완수 점수 79%를 기록해 단일 스텝 기반 GR00T N1.7(42%)보다 87% 상대 개선을 보였고 최상위 경쟁자 GDN(56%)보다도 큰 폭으로 앞섰다. 사전학습 컨텍스트 길이를 단계적으로 늘린 실험에서 RoboTTT는 128→8K로 갈수록 닫힌 루프 성능이 꾸준히 상승해 8K 사전학습이 1K 대비 63% 상대 향상을 달성했다. 추가로 한 번의 인간 시연으로 구성 정보를 추출해 모방하는 one-shot in-context imitation에서 RoboTTT는 10회 중 6회의 완전 성공을 기록한 반면 GDN은 성공이 없었다.
관련 Figure

이 그림은 RoboTTT가 다양한 단계의 조립 작업에서 손-도구 상호작용과 객체 조작을 통해 단계별 회복 및 미세 조정을 수행하는 장면을 연속적으로 보여준다. 그림 구성은 각 과제의 전형적 실패와 RoboTTT의 재시도·정렬·삽입 동작을 시퀀스로 제시해 긴 문맥을 기반으로 한 단계 식별과 복구 행동이 어떻게 나타나는지를 직관적으로 전달한다.
세 가지 장기 조립 과제(Pup Go Car, Circuit, Gear Bot)의 대표 롤아웃 장면을 연속 프레임으로 배치해 모델 행동과 작업 단계를 시각적으로 비교한 Figure이다.

그래프는 RoboTTT가 사전학습 컨텍스트 길이를 늘릴수록 닫힌 루프 성능이 꾸준히 상승하는 특성을 보이며, 1K 이상의 컨텍스트에서 단기 컨텍스트 기반의 베이스라인을 넘어섬을 수치로 확인시켰다. 대비하여 GDN은 유사한 스케일링 이득을 보이지 않아 fast weight의 그래디언트 기반 업데이트와 메타학습된 초기화가 긴 컨텍스트 학습에서 핵심 역할을 수행함을 뒷받침한다.
사전학습 컨텍스트 길이(128~8K)에 따른 평균 과제 완수 점수의 변화를 선 그래프로 나타낸 Figure이다.
기술 상세
모델 아키텍처는 사전학습된 GR00T N1.7을 기반으로 16개의 DiT 레이어 각각에 fast model(Two-layer MLP)을 삽입하고 register tokens(N=16)을 각 타임스텝에 추가해 VL 정보를 시간축으로 전달했다. TTT의 핵심 수학적 동작은 각 타임스텝의 키 K_t와 값 V_t를 fast model f_W의 입력·출력으로 대응시키는 MSE 손실 L_FW를 통해 fast weights W를 W_t ← W_{t-1} - η ∇W L_FW(f{W_{t-1}}(K_t), V_t)로 갱신하고, 업데이트된 W_t로 쿼리 Q_t에 대해 O_t = f_{W_t}(Q_t)을 계산하는 '업데이트 후 적용' 사이클이다. 학습은 sequence action forcing을 사용한 flow-matching 손실과 TBPTT를 조합해 수행되며, 각 액션 청크별로 τ_t를 독립적으로 샘플링해 노이즈 수준을 분리함으로써 시퀀스 학습의 불안정성을 줄였다.
한계점
사전학습 컨텍스트 길이를 늘리면 전체 학습 비용이 증가해 계산 자원이 많이 필요하다. 논문에서 사용한 TTT 설정은 일반화 가능성이 보였지만 TTT 레이어를 위한 로봇 특화 자기지도 목표나 더 효율적 트레이닝 기법이 추가적으로 필요할 수 있다. RoboTTT는 모든 실패 모드를 해결하지 못하며 강화학습과 결합해 직접적으로 성공 확률을 최적화하는 후속 연구가 필요하다.
실무 활용
RoboTTT는 장기 문맥을 안정적으로 활용해야 하는 로봇 조립·정비·연속 작업에서 즉시 적용 가능한 아키텍처적 방향성을 제공한다. 특히 외부 교란 복구, 한 번의 시연으로 작업을 학습하는 현장 적용 시나리오에서 기존 단기 컨텍스트 정책 대비 명확한 성능·복원력 이득이 확인되었다.
- 현장 조립 라인에서 여러 단계로 이루어진 작업을 연속적으로 수행하면서 중간 단계 실패를 자동으로 복구하는 작업 자동화
- 인간 작업자의 단일 시연 영상을 받아서 로봇이 즉시 새로운 구성에 대해 한 번만 보고 작업을 수행하는 현장 적응 작업
- 로봇이 배포 중 수집한 실패 사례와 인간 보정을 활용해 온라인으로 정책을 개선하는 데이터 효율적 보정 파이프라인
- 반복적이지만 길이가 긴 검사·유지보수 작업에서 누적 관찰을 압축해 장시간 의사결정에 활용하는 로봇 운영
코드 공개 여부: 미확인
키워드
용어 해설
- Test‑Time Training
- — 학습 중과 추론 중 모두 일부 매개변수(빠른 가중치)를 그래디언트로 갱신하여 최신 문맥 정보를 파라미터 공간에 압축하는 기법으로, 긴 시퀀스의 문맥을 메모리에 유지하지 않고도 조건화할 수 있게 해 주어 로봇의 온라인 적응과 문맥 검색을 가능하게 한다.
- Fast Weights
- — 추론 시에도 학습률로 업데이트되는 작은 서브네트워크의 파라미터로, 입력 시퀀스의 키-값 쌍을 내부 파라미터로 압축해 이후 쿼리에서 해당 문맥을 재검색하도록 작동하며 장기 문맥을 일정한 추론 비용으로 유지하는 핵심 수단이다.
- TBPTT
- — 긴 시퀀스를 여러 세그먼트로 나누어 각 세그먼트 내부에서만 역전파를 허용하고 세그먼트 경계에서는 활성화 메모리를 해제하되 빠른 가중치는 이어서 전달하여 전체 시퀀스 학습을 메모리 한도 내에서 확장하는 학습 전략이다.
- Sequence Action Forcing
- — 시퀀스 훈련에서 각 액션 청크별로 독립된 노이즈 레벨을 샘플링해 흐름 매칭(flow-matching) 손실을 계산하는 방식으로, 시퀀스 전체에 동일한 노이즈를 적용할 때 발생하는 학습 불안정성을 완화해 장기 시퀀스의 안정적 학습을 가능하게 한다.
- DAgger Distillation
- — 부적절한 로봇 행동을 문맥으로 남기고 인간의 보정만을 학습 목표로 삼아 빠른 가중치가 실패-수정 대응을 학습하도록 하는 절차로, 실패 자체를 문맥으로 활용해 온라인 복구 능력을 얻도록 설계된 메타학습 방식이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.