본문으로 건너뛰기

Playful Agentic Robot Learning: RATs를 통한 놀이 기반 지속 가능 로봇 스킬 학습 및 재사용

로봇 학습은 대개 특정 과제 해결에 집중하고 재사용 가능한 고수준 스킬 축적이 미미하다. RATs는 self-directed play를 통해 코드를 실행하고 피드백을 받아 성공 실행을 코드 스킬로 distill하며, 이 스킬 라이브러리를 다운스트림 작업에 재사용한다. LIBERO-PRO와 MolmoSpaces에서 다운스트림 태스크의 평균 성공이 크게 향상되고, 학습된 스킬의 cross-environment 전이 및 sim-to-real 가능성도 확인된다.

왜 중요한가

로봇 학습은 대개 특정 과제 해결에 집중하고 재사용 가능한 고수준 스킬 축적이 미미하다. RATs는 self-directed play를 통해 코드를 실행하고 피드백을 받아 성공 실행을 코드 스킬로 distill하며, 이 스킬 라이브러리를 다운스트림 작업에 재사용한다. LIBERO-PRO와 MolmoSpaces에서 다운스트림 태스크의 평균 성공이 크게 향상되고, 학습된 스킬의 cross-environment 전이 및 sim-to-real 가능성도 확인된다.

핵심 기여

Play-Time 기반 지속 가능한 스킬 학습 구조

Task Proposer/Execution/Memory-Management 세 팀으로 구성된 RATs가 놀이 환경에서 탐색 과제 제안, 코드 작성/실행, 실패 진단 및 메모리 업데이트를 반복해 코드 스킬을 라이브러리에 축적한다.

코드-기반 스킬 라이브러리의 재사용

성공적으로 산출된 코드 조각을 실시간 실행 정책에 삽입 가능하도록 실질적 인터페이스를 제공하고, 테스트 시 라이브러리를 Plug-and-Play로 불러와 다운스트림 문제 해결에 활용한다.

다환경 일반화 및 전이성 강화

라이브러리로 학습된 스킬이 LIBERO-PRO, MolmoSpaces 외에 RoboSuite 및 실세계 설정으로도 전이되어 성능 개선을 달성한다.

Dense 피드백을 통한 학습 효율 증가

계획-실행-검증-진단 루프를 통해 중간 단계의 피드백을 제공하고 실패 사례에서 교훈을 추출해 재시도와 스킬 추출에 반영한다.

핵심 아이디어 이해하기

단계 1: 출발점은 Code-as-Policy가 perception-plan-control 파이프라인을 실행하는 코드 생성을 다루되, 보편적 재사용 스킬의 부족이 성능의 제약으로 작용한다. 단계 2: RATs는 놀이를 통해 Novelty와 Learnability를 균형 있게 확보하고, Task Proposer는 scene context와 현재 라이브러리로부터 새로운 탐색 과제를 제시한다. Execution 팀은 계획-코드 생성-실행-검증-진단 루프를 거치며, 실패에서 얻은 교훈은 Memory에 저장하고 실험적 스킬로 라이브러리에 반영한다. 단계 3: 학습된 스킬은 Verfied 우선 검색 및 deprecated 차단으로 관리되며, 테스트 시 CaP-Agent0이나 RATs Execution 경로에서 재사용된다. 이로써 다운스트림 태스크 성능이 증가하고 cross-domain 일반화 및 실세계 적용 가능성이 입증된다.

방법론

  1. 전체 접근: RATs는 Play-Time에서 스킬 라이브러리 L과 실패 메모리 M을 축적하고, Test-Time에는 두 저장소를 활용해 Task Proposer/Execution/Memory 팀으로 구성된 협력 루프를 수행한다. 2) 핵심 알고리즘: Task Proposer는 현 scene context c_t, 학습된 라이브러리 L, 실패 메모리 M을 입력으로 후보 과제 집합 T_t를 생성하고, Object-Skill Novelty N(τ)와 Competence Frontier F(τ)를 곱한 점수로 과제를 선택한다. Environment Creator가 play 환경을 구성한다. Planner-Verifier, Policy Writer, Quality Checker, Goal Verifier, Per-Step Verifier, Failure Diagnoser가 순환하며, 재시도는 고유한 실패 원인을 바탕으로 보완한다. 3) 메모리 관리: 성공 시 실행 코드의 모듈을 추출해 L에 experimental로 저장하고, 실패 시 M에 교훈을 저장한다. 정기적으로 Memory Curator가 스킬 간 중복을 정리하고 필요 시 새로운 보조 함수를 제안한다. 4) 평가 절차: Play 이후 학습된 라이브러리를 고정하고, CaP-Agent0에 Plug-and-Play로 적용하거나 RATs Execution로 해결한다. 수학적/구현적 디테일은 본문에 의거하여 Promp interfaces, 검증 모듈, 추출 규칙을 그대로 활용한다.

관련 Figure

RATs Play-Time 파이프라인 다이어그램
Diagram

Play-Time Task Proposer-Execution-Verification-Diagnosis의 흐름을 시각적으로 보여준다.

RATs Play-Time 파이프라인 다이어그램

환경-학습-피드백 루프 도식
Diagram

놀이 단계에서의 탐색과 학습의 피드백 흐름을 강조하며 재사용 가능 스킬의 축적과 연결된다.

환경-학습-피드백 루프 도식

주요 결과

4.2 In-Domain 평가에서 LIBERO-PRO의 RATs는 CaP-Agent0 대비 평균 성공률을 20.6pp 증가시켜 43.8%를 기록했다(Table 1). MolmoSpaces에서는 평균 38.0%로 CaP-Agent0 대비 17.0pp 상승했다(Table 2). 4.3 Cross-Environment Transfer에서 LIBERO-PRO에서 학습된 스킬의 RoboSuite 전이가 49.1%로 증가하며(+8.9pp), 특히 cube/2-arm lifting에서 큰 이득을 보였다. 실세계 평가에서도 RATs 스킬을 사용하면 평균 성공률이 25.0%로 증가(+8.8pp)한다. 4.4 Ablation에서 Curiosity 기반 Play가 효과적임을 확인했고, Play와 테스트 시 Execution의 상호 보완 효과를 확인했다. 4.5 Sim-to-Real 평가에서 LIBERO-PRO 학습 스킬을 실제 로봇에 적용해 CaP-Agent0 대비 8.8pp 개선했다. 결론적으로 RATs는 놀이 기반의 지속적 스킬 학습을 통해 코드 스킬의 라이브러리 제작과 재사용이 가능하며, 다운스트림 태스크의 일반화 성능을 크게 향상시킨다.

관련 Figure

MolmoSpaces vs LIBERO-PRO 스냅샷
Screenshot

실험 구성 및 벤치마크 구분을 시각적으로 보여주며 비교 관찰에 도움을 준다.

MolmoSpaces vs LIBERO-PRO 스냅샷

MolmoSpaces 학습에서 스킬 라이브러리 확장
Diagram

50회 학습에서 스킬 라이브러리 증가와 실패 기억 증가를 시각적으로 보여준다.

MolmoSpaces 학습에서 스킬 라이브러리 확장

MolmoSpaces evaluation 시나리오 다이어그램
Diagram

학습-평가 파이프라인 및 평가 시나리오의 연결 고리를 시각화한다.

MolmoSpaces evaluation 시나리오 다이어그램

MolmoSpaces eval 샘플과 성공 사례 흐름
Diagram

평가 성공으로 이어지는 플레이-의존 스킬 사용의 흐름을 보강한다.

MolmoSpaces eval 샘플과 성공 사례 흐름

기술 상세

  1. 아키텍처: RATs는 Task Proposer, Execution, Memory Curator로 구성된 다-에이전트 파이프라인으로, play-time 동안 환경(context), 초기 primitives, learned skills를 입력으로 삼아 탐색 과제를 제안하고 수행한다. 2) 핵심 수식/알고리즘: 후보 τ에 대해 score(τ) = N(τ) × F(τ)로 계산하고, Goldilocks 원리로 학습 가능 영역(N≈0.5)를 찾고, 필요한 경우 실패 기억에서 보정한다. 3) 차별점: 기존 CaP 기반의 단일 에이전트 학습과 달리, RATs는 실패 메모리/피드백 루프를 통해 중간 단계의 성공 가능성을 향상시키고 재사용 가능한 함수로 추출한다. 4) 구현 및 학습 세부: 학습된 스킬은 experimental → verified → deprecated의 라이프사이클을 거치며, 라벨링된 디펜던시 및 의존성 관리 하에 런타임 네임스페이스에 주입된다. 5) 평가 방법: 다운스트림 Task에서 스킬 라이브러리를 플러그인으로 불러와 성능을 비교하고, RATs Exec. 경로의 전체 파이프라인과 CaP-Agent0의 성능 차이를 측정한다.

관련 Figure

학습된 스킬 예시 코드 스니펫
Screenshot

LIBERO/MolmoSpaces 스킬 인터페이스를 구체적으로 보여주며 재사용 구조를 설명한다.

학습된 스킬 예시 코드 스니펫

한계점

실험은 대부분 시뮬레이션 기반이며, 물리적 대규모 배치에서의 성능 검증이 필요하다. 스킬 재사용이 잘 맞지 않는 다운스트림 태스크에서 성능 저하 가능성이 있으며, 실세계 확장에 따른 저수준 컨트롤러의 제약과 추상화의 한계가 있다. 또한 RATs의 추론 비용은 증가한다.

실무 활용

RATs에서 학습된 스킬 라이브러리는 플러그 앤 플레이 방식으로 Code-as-Policy 기반 로봇 시스템에 재사용 가능하며, 시뮬레이션 학습과 실세계 적용 간의 간극을 줄인다.

  • 자율 로봇 팔의 재사용 가능한 제어 루틴 확보
  • 시뮬레이션 학습된 스킬의 실세계 적용
  • Code-as-Policy 기반 로봇 시스템의 신뢰성 향상
  • 자율 탐색 기반 커리큘럼 학습 도구 도입

코드 공개 여부: 공개

코드 저장소 보기

키워드

Code-as-Policyembodied coding agentself-directed playexploratory tasksrobot-code policiesskill librarydownstream tasksLIBERO-PROMolmoSpacesRoboSuite
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 17.수집 2026. 06. 20.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.