본문으로 건너뛰기

ASPIRE: 에이전틱 스킬 발견을 통한 로봇 제어의 지속 학습 시스템

로봇 프로그램의 실패 원인은 인지, 모션, 접촉 역학 등 여러 층위가 얽혀 있어 단일 피드백 신호로는 원인 귀속과 수리가 어렵다. Aspire는 프리미티브 단위의 다중모달 실행 흔적을 노출해 실패를 정확히 귀속하고 검증된 수리 패턴을 재사용 가능한 스킬로 축적한다. 이 접근은 다양한 과제에서 반복적으로 성능을 쌓아 제로샷 일반화와 시뮬레이터에서 실로의 전이를 촉진한다.

용어 해설

코드 기반 정책 패러다임(Code-as-Policy)
로봇 행위를 텍스트 코드로 명시하여 LLM이 직접 프로그램을 생성하고 수정하는 접근법이다. 이 방식은 정책 행동을 명시적으로 디버깅하고 수정할 수 있도록 실행 흔적을 활용한다. Aspire 문맥에서는 로봇 제어, 인지, 계획 호출을 조합해 실행 가능한 파이프라인을 생성하는 핵심 설계 방식이다.
다중모달 실행 흔적(Multimodal Traces)
각 원시 프리미티브 호출에 대해 입력, 출력, 리턴 상태와 관련 RGB 키프레임, 오버레이, 그립 후보, 모션 계획 결과 등을 구조화해 기록한 데이터이다. 이 흔적은 실패 원인 귀속과 수리 가설 검증에 직접 사용된다. Aspire는 이 정보를 에이전트가 선택적으로 검사하도록 노출해 정밀한 디버깅을 가능하게 했다.
스킬 라이브러리(Skill Library)
검증된 수리 패턴과 적용 조건, 코드 스케치 등을 컴팩트한 인컨텍스트 가이던스로 저장한 재사용 가능한 지식 저장소이다. 에이전트는 이 저장소에서 유사 실패 시점에 관련 스킬을 불러와 즉시 적용하거나 참조한다. Aspire는 라이브러리 크기가 커질수록 장기적 제로샷 일반화가 향상된다고 보고했다.
진화적 탐색 절차(Evolutionary Search)
복수의 후보 프로그램을 생성해 실행 결과와 잔여 실패 모드를 기반으로 다음 세대를 선택하고 변형해가는 반복적 탐색 방식이다. 이 절차는 단일 궤적 수리로 인한 지역 최적화에 빠지는 것을 완화한다. Aspire는 이 방식을 통해 서로 다른 전략을 병렬로 검증하고 라이브러리에 유용한 패턴을 추출했다.

코드 예제

python
for angle_deg in [180, -90, 90, -45, 45]:
    # south, sides only
    angle = np.radians(angle_deg)
    tx = radio_pos[0] + np.cos(angle)
    ty = radio_pos[1] + 0.7 * np.sin(angle)
    txy = radio_pos[:2] + [np.cos(angle), 0.7 * np.sin(angle)]
    face_yaw = np.arctan2(radio_pos[1]-ty, radio_pos[0]-tx)
    radio_pos[0] = tx
    moved = safe_navigate([tx, ty, face_yaw])
    if moved and dist_to(radio_pos[:2]) < 0.8:
        break

수집된 PLANNING_ERROR에 대응해 대상물 주변의 여러 각도에서 접근 목표를 샘플링하고 도달 가능성을 확인하는 멀티앵글 접근 알고리즘의 파이썬 예시이다.

text
Algorithm 1 Evolutionary search over programs
Inputs: task τ, initial program P^0, debug/val sets S_dbg, S_val, skill library L, agent M, budget (K,T), threshold θ
(r*, Z0) ← Execute(P^0, S_dbg); H ← {(P^0, r*, Z0)}
for i = 1..T do
  propose {P_i^k}_{k=1}^K ← ProposeRepairs(M, τ, Top3(H), L, H)
  for k = 1..K do
    (r_i^k, Z_i^k) ← Execute(P_i^k, S_dbg)
  end for
  H ← H ∪ {(P_i^k, r_i^k, Z_i^k)}
  k* ← argmax_k r_i^k
  if r_i^{k*} > r* then (P*, r*) ← (P_i^{k*}, r_i^{k*}) end if
  if r* ≥ θ then break end if
end for
(r_val, Z_val) ← Execute(P*, S_val)
G ← ExtractValidatedPatterns(H, P*, r_val, Z_val)
return (P*, r_val, G)

진화적 탐색 절차의 전체 흐름을 의사코드로 표현한 블록이다. 각 후보 프로그램을 디버그 환경에서 실행해 점수를 얻고 최상 후보를 갱신한 뒤 검증 세트에서 일반화 가능 패턴을 추출한다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 30.수집 2026. 07. 03.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.