용어 해설
- 중요도 샘플링(Importance Sampling)
- — 행동 정책으로부터 수집한 데이터를 목표 정책 업데이트에 재사용할 때 확률비(ratio)를 사용해 표본의 기여도를 재가중하는 기법으로, 오프정책 데이터 효율성을 높이지만 확률비 분산으로 학습 불안정성이 발생할 수 있어 안정화 기법이 필요하다.
- 확률 용량(Probability Capacity)
- — 정책이 업데이트에 할당할 수 있는 '확률 질량'의 예산을 정형화한 개념으로, 보수적 클리핑은 이 예산을 조기에 소진시켜 정답이지만 낮은 신뢰도의 추론 경로에 대해 충분한 업데이트를 발생시키지 못하게 하는 구조적 제약을 의미한다.
- 스톱 그래디언트 연산자(Stop-Gradient)
- — 역전파 시 특정 신호의 그래디언트 전달을 차단하여 파라미터의 일부를 고정시킨 채 다른 요소만 학습시키는 연산으로, 본 논문에서는 정책을 현재 상태에 고정해 양의 이득에 대한 그라디언트를 비제한으로 흐르게 하는 데 사용된다.
- 비대칭 최적화(Asymmetric Optimization)
- — 같은 이득 신호라도 부호에 따라 서로 다르게 처리하는 최적화 설계로, 본문 맥락에서는 양의 이득은 클리핑 없이 유지하여 탐색을 촉진하고 음의 이득은 클리핑으로 제어해 학습 불안정을 억제하는 전략을 가리킨다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.