본문으로 건너뛰기

mixed-policy-optimization

혼합정책 최적화

guided 롤아웃과 unguided 롤아웃을 함께 학습하여 가이던스가 테스트 시점 unguided 정책으로 내부화되도록 하는 최적화 방식.