Regularized Reinforcement Learning
정규화 강화학습
행동에 따른 보상만 최대화하지 않고 정규화 항을 함께 적용해 학습 결과의 안정성과 정책의 성질을 조절하는 강화학습 방식입니다. 이 연구에서는 답변 생성과 abstention을 모두 행동으로 포함해 추론 중단의 비용·정보 균형을 수학적으로 다룹니다.
정규화 강화학습
행동에 따른 보상만 최대화하지 않고 정규화 항을 함께 적용해 학습 결과의 안정성과 정책의 성질을 조절하는 강화학습 방식입니다. 이 연구에서는 답변 생성과 abstention을 모두 행동으로 포함해 추론 중단의 비용·정보 균형을 수학적으로 다룹니다.