본문으로 건너뛰기
mixed-policy-optimization
혼합정책 최적화
guided 롤아웃과 unguided 롤아웃을 함께 학습하여 가이던스가 테스트 시점 unguided 정책으로 내부화되도록 하는 최적화 방식.
비슷한 개념
behavior-policy
policy-optimization
policy-merging
policy-recovery
learned-optimization
hindsight-guided-opd
stochastic-policy
opd
← 용어 사전 전체 보기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필