본문으로 건너뛰기

제로샷 시뮬-실세계 로봇 학습: 반응적 포착에 대한 정교한 조작 연구

Dexterous manipulation은 접촉-rich·동적 환경에서 파라미터 불확실성과 센서 노이즈에 취약하다. 기존의 domain randomization은 에피소드당 한 인스턴스만 변화를 주어 현실 다변성에 충분히 노출되지 않는 한계가 있다. DRIS는 다중 인스턴스를 병렬로 모델링하고 공유된 행동 아래 상태를 함께 진전시킴으로써 불확실한 물리적 변동성을 더 풍부하게 근사하고, 시뮬레이션-현실 간 차이를 줄여 제로샷 transfer를 가능하게 한다. 시뮬레이션 학습에서 DRIS 크기 N이 증가할수록 안정성과 일반화가 향상되며, 실세계에서의 미세 튜닝 필요를 완화한다.

용어 해설

DRIS
Domain-Randomized Instance Set(DRIS)은 물리 파라미터 변동성을 표현하는 인스턴스들의 집합으로, 동일 정책이 다중 시나리오를 공유해 학습하도록 한다. 각 인스턴스는 서로 다른 c(i)를 가지며, 이들의 상태는 동일한 행동 하에 함께 진화한다. DRIS는 시뮬레이션-현실 간 불확실성에 대한 정책의 내재적 강건성을 촉진한다.
FiLM
FiLM은 Feature-wise Linear Modulation으로, 입력 특징 zt에 대해 ut에 의해 스케일링과 바이어스를 적용하는 모듈이다. 이는 네트워크의 특정 조건(예: plate tilting) 변화에 따라 표현을 다르게 조정하여 제어 정책의 적응성을 개선한다.
Chamfer 거리(Chamfer Distance)
DRIS 인코더의 사전 학습에서 입력 DRIS 상태(St)와 재구성 DRIS 상태(Se) 간의 유사성을 측정하는 손실로 사용된다. 두 집합 간의 최근접 포인트 간 거리의 합으로 정의된다.
ManiSkill
로봇 학습용 시뮬레이션 플랫폼으로, DRIS 기반 학습의 시뮬레이션 환경으로 사용된다.
Rodrigues 공식(Rodrigues’ formula)
회전 행렬을 표현하는 수학적 방법으로, plate의 회전(βt)을 계산할 때 사용된다.
PPO
Proximal Policy Optimization으로, DRIS 학습에서 정책 파라미터를 업데이트하는 강화학습 알고리즘이다.

코드 예제

python
def compute_reward(dt, vt, nt, le, eta):
    d_perp = dt.dot(nt)
    d_parallel = max(0.0, np.linalg.norm(dt - d_perp*nt))
    v_perp = vt.dot(nt)
    v_parallel = np.linalg.norm(vt - v_perp*nt)
    rv = 0.5*(np.exp(-v_parallel**2/eta**2) + np.exp(-max(v_perp, -0.1)**2/eta**2))
    rp = -1 if (d_perp < 0 or d_parallel > le) else 0
    return rv + rp

DRIS 상태에 따른 보상을 계산하는 예시 코드.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 10.수집 2026. 05. 21.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.