본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
Dynamic MDP
동적 MDP
중급
보상이 시간에 따라 변화하는 환경에서 상태-정책 쌍의 최적화를 다루는 마르코프 결정 과정의 변형. 즉, 보상이 시간에 종속적일 때도 최적 정책을 고려한다.
비슷한 개념
markov-decision-process
mdp
non-stationary-environment
policy
greedy-policy
continual-adaptation
optimal-policy
stochastic-policy
← 용어 사전 전체 보기