용어 해설
- 오프폴리시 강화학습(Off-policy Reinforcement Learning)
- — 과거에 수집한 상태·행동·보상 전이를 replay buffer에 저장한 뒤 현재 정책 학습에 재사용하는 강화학습 방식이다. 환경 상호작용 데이터를 여러 번 활용해 데이터 효율을 높이지만, 현재 정책이 거의 방문하지 않은 영역의 가치를 추정할 때 extrapolation error가 발생할 수 있다.
- Replay Buffer
- — 에이전트가 환경에서 수집한 상태, 행동, 보상, 다음 상태 전이를 저장하는 메모리 구조다. 학습 시 저장된 전이 중 일부를 minibatch로 추출해 critic과 actor를 갱신하며, 샘플링 방식이 데이터 재사용 효율과 학습 안정성에 직접 영향을 준다.
- Clipped Double-Q
- — 두 개의 critic이 계산한 Q 값 중 작은 값을 target으로 선택해 과대추정을 억제하는 기법이다. replay buffer가 충분히 다루지 못한 행동의 가치가 부풀려지는 문제를 줄이지만, 데이터가 풍부한 환경에서는 지나친 보수성과 두 번째 critic의 계산 비용을 추가할 수 있다.
- Parameter Projection Normalization
- — Optimizer가 가중치를 갱신한 뒤 각 층의 weight matrix를 정해진 norm 범위 안으로 투영하는 제약이다. Frobenius norm을 제한하면 spectral norm과 네트워크의 Lipschitz 상한도 함께 제한되어 가치함수의 extrapolation을 안정화하지만, replay 데이터가 풍부할 때는 함수 표현력을 줄일 수 있다.
- Sim-to-Real
- — 시뮬레이션에서 학습한 로봇 정책을 실제 로봇의 제어에 이전하는 과정이다. 이 논문은 Unitree G1의 시뮬레이션 학습과 실제 보행 배포를 같은 학습·적응 파이프라인에서 연결하고, 실제 배포에 필요한 학습 wall time을 비교한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
