용어 해설
- 잔류 정책(Residual Policy)
- — 사전학습된 기본 정책의 출력에 더해지는 보정 정책으로서, 기본 정책이 제시한 단기 동작 의도를 입력으로 받아 촉각 신호 기반의 보정을 예측한다. 이 방식은 전체 정책을 재학습하지 않고 접촉 상태에서의 세부 조정을 학습하도록 설계되어 샘플 효율을 높인다. 본문에서는 잔류 정책이 동작 덩어리 action chunk와 키포인트 목표를 입력으로 받아 델타 동작을 출력하는 구조로 사용된다.
- 촉각 인코더(Tactile Encoder)
- — 촉각 센서 이미지나 마커 움직임을 저차원 특징으로 변환하는 신경망 모듈로서, 사전학습된 AnyTouch2 등 다양한 백본을 활용하거나 경량 투영층만 미세조정하여 특정 작업으로 적응시킨다. 본문에서는 warm-start 단계에서 재구성 손실과 critic 손실을 함께 사용해 촉각 인코더를 안정적으로 적응시킨다. 촉각 인코더의 적응은 잔류 학습 안정성과 샘플 효율에 직접적인 영향을 미친다.
- 워밍업 시작(Warm-start)
- — 오프라인 시각 기반 정책을 고정한 상태에서 해당 정책의 자율 롤아웃을 통해 초기 재생 버퍼를 채우고 critic과 촉각 인코더를 초기화 또는 적응시키는 단계이다. 워밍업 단계는 랜덤 초기 critic이 초래하는 불안정한 탐색을 완화하고 촉각 표현의 도메인 차이를 줄여 이후 온라인 잔류 학습의 안정성과 효율성을 높인다. 본문에서는 자율 롤아웃에 대한 궤적 수준의 촉각 증강까지 포함해 초기 데이터 다양성을 향상시켰다.
- 플로우 유도 정책(Flow-guided Policy)
- — 영상으로부터 예측한 객체 수준의 흐름을 입력으로 받아 작업 수준의 동작 우선순위와 서브골을 생성하는 시각 정책 변형이다. 흐름은 키포인트 중심의 3D 중심 좌표와 상대 변환을 포함하여 정책과 보상에 객체 중심의 밀집 신호를 제공한다. 본문에서는 이 흐름을 이용해 기저 정책 행동과 잔류 정책에 공통된 작업 지시를 전달한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




