본문으로 건너뛰기

Dynamic MDP

동적 MDP

보상이 시간에 따라 변화하는 환경에서 상태-정책 쌍의 최적화를 다루는 마르코프 결정 과정의 변형. 즉, 보상이 시간에 종속적일 때도 최적 정책을 고려한다.