용어 해설
- 검증 가능한 보상을 통한 강화학습(RLVR)
- — 수학 문제의 정답이나 코드 실행 결과처럼 정답 여부를 객관적으로 검증할 수 있는 환경에서의 강화학습 기법이다. 보상이 명확하지만 정답에 도달하는 경로가 길어 학습 데이터 확보가 어려운 환경에서 주로 사용된다.
- 수축 추정량(Shrinkage Estimator)
- — 두 개 이상의 서로 다른 추정치를 통계적으로 결합하여 전체적인 평균 제곱 오차(MSE)를 줄이는 기법이다. 데이터가 부족할 때는 안정적인 사전 지식 쪽으로 값을 '수축'시켜 분산을 억제하는 효과가 있다.
- 정책 경사(Policy Gradient)
- — 강화학습에서 에이전트의 행동 규칙(정책)을 직접 최적화하는 알고리즘 클래스이다. 보상의 기댓값을 높이는 방향으로 신경망의 가중치를 갱신하며, 안정적인 학습을 위해 기준점(Baseline) 설정이 매우 중요하다.
- 단단계 예측 할당(OSLA)
- — 현재 상태에서 한 단계를 더 진행했을 때 얻을 수 있는 통계적 이득과 소요되는 비용을 비교하여 의사결정을 내리는 방식이다. 이 논문에서는 추가적인 데이터 샘플링이 필요한지 실시간으로 판단하는 데 사용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.