용어 해설
- DRIS
- — Domain-Randomized Instance Set(DRIS)은 물리 파라미터 변동성을 표현하는 인스턴스들의 집합으로, 동일 정책이 다중 시나리오를 공유해 학습하도록 한다. 각 인스턴스는 서로 다른 c(i)를 가지며, 이들의 상태는 동일한 행동 하에 함께 진화한다. DRIS는 시뮬레이션-현실 간 불확실성에 대한 정책의 내재적 강건성을 촉진한다.
- FiLM
- — FiLM은 Feature-wise Linear Modulation으로, 입력 특징 zt에 대해 ut에 의해 스케일링과 바이어스를 적용하는 모듈이다. 이는 네트워크의 특정 조건(예: plate tilting) 변화에 따라 표현을 다르게 조정하여 제어 정책의 적응성을 개선한다.
- Chamfer 거리(Chamfer Distance)
- — DRIS 인코더의 사전 학습에서 입력 DRIS 상태(St)와 재구성 DRIS 상태(Se) 간의 유사성을 측정하는 손실로 사용된다. 두 집합 간의 최근접 포인트 간 거리의 합으로 정의된다.
- ManiSkill
- — 로봇 학습용 시뮬레이션 플랫폼으로, DRIS 기반 학습의 시뮬레이션 환경으로 사용된다.
- Rodrigues 공식(Rodrigues’ formula)
- — 회전 행렬을 표현하는 수학적 방법으로, plate의 회전(βt)을 계산할 때 사용된다.
- PPO
- — Proximal Policy Optimization으로, DRIS 학습에서 정책 파라미터를 업데이트하는 강화학습 알고리즘이다.
코드 예제
def compute_reward(dt, vt, nt, le, eta):
d_perp = dt.dot(nt)
d_parallel = max(0.0, np.linalg.norm(dt - d_perp*nt))
v_perp = vt.dot(nt)
v_parallel = np.linalg.norm(vt - v_perp*nt)
rv = 0.5*(np.exp(-v_parallel**2/eta**2) + np.exp(-max(v_perp, -0.1)**2/eta**2))
rp = -1 if (d_perp < 0 or d_parallel > le) else 0
return rv + rpDRIS 상태에 따른 보상을 계산하는 예시 코드.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.