본문으로 건너뛰기

RoboTTT: 로봇 정책을 위한 8K 타임스텝 장기 컨텍스트 확장

RoboTTT는 Test‑Time Training으로 fast weights를 활용해 시각·동작 문맥을 8K 타임스텝까지 확장하여 장기 다단계 조립 및 한 번 보기 모방에서 성능과 복원력을 크게 개선했다.

용어 해설

테스트 시점 학습(Test‑Time Training)
학습 중과 추론 중 모두 일부 매개변수(빠른 가중치)를 그래디언트로 갱신하여 최신 문맥 정보를 파라미터 공간에 압축하는 기법으로, 긴 시퀀스의 문맥을 메모리에 유지하지 않고도 조건화할 수 있게 해 주어 로봇의 온라인 적응과 문맥 검색을 가능하게 한다.
빠른 가중치(Fast Weights)
추론 시에도 학습률로 업데이트되는 작은 서브네트워크의 파라미터로, 입력 시퀀스의 키-값 쌍을 내부 파라미터로 압축해 이후 쿼리에서 해당 문맥을 재검색하도록 작동하며 장기 문맥을 일정한 추론 비용으로 유지하는 핵심 수단이다.
절단된 역전파(Truncated BPTT)(TBPTT)
긴 시퀀스를 여러 세그먼트로 나누어 각 세그먼트 내부에서만 역전파를 허용하고 세그먼트 경계에서는 활성화 메모리를 해제하되 빠른 가중치는 이어서 전달하여 전체 시퀀스 학습을 메모리 한도 내에서 확장하는 학습 전략이다.
시퀀스 액션 포싱(Sequence Action Forcing)
시퀀스 훈련에서 각 액션 청크별로 독립된 노이즈 레벨을 샘플링해 흐름 매칭(flow-matching) 손실을 계산하는 방식으로, 시퀀스 전체에 동일한 노이즈를 적용할 때 발생하는 학습 불안정성을 완화해 장기 시퀀스의 안정적 학습을 가능하게 한다.
DAgger 증류(DAgger Distillation)
부적절한 로봇 행동을 문맥으로 남기고 인간의 보정만을 학습 목표로 삼아 빠른 가중치가 실패-수정 대응을 학습하도록 하는 절차로, 실패 자체를 문맥으로 활용해 온라인 복구 능력을 얻도록 설계된 메타학습 방식이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 16.수집 2026. 07. 18.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.