internal-trust-region-iterations
내부 신뢰영역 반복
한 배치 내에서 행동 정책(behavior)과 목표 정책(target)을 분리한 뒤 중요도 샘플링과 클리핑 기반의 신뢰영역 업데이트를 여러 내부 epoch 동안 반복하여 한 단계의 최적화 오차를 줄이고 샘플 효율을 높이는 절차이다.
내부 신뢰영역 반복
한 배치 내에서 행동 정책(behavior)과 목표 정책(target)을 분리한 뒤 중요도 샘플링과 클리핑 기반의 신뢰영역 업데이트를 여러 내부 epoch 동안 반복하여 한 단계의 최적화 오차를 줄이고 샘플 효율을 높이는 절차이다.