본문으로 건너뛰기
Dynamic MDP
동적 MDP
보상이 시간에 따라 변화하는 환경에서 상태-정책 쌍의 최적화를 다루는 마르코프 결정 과정의 변형. 즉, 보상이 시간에 종속적일 때도 최적 정책을 고려한다.
비슷한 개념
Markov Decision Process
MDP
Non-stationary Environment
Policy
Stochastic MDP
Greedy Policy
Continual Adaptation
Optimal Policy
← 용어 사전 전체 보기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필