본문으로 건너뛰기

Constrained RL

제약 강화학습

행동 정책이 보상뿐 아니라 안전 제약과 위반 조건도 만족하도록 학습하는 강화학습 방식이다. 제약 위반이 발생하면 관련 행동에 비용이나 패널티를 부여하지만, 위반이 늦게 나타나면 원인 행동을 정확히 찾기 어렵다는 문제가 있다.