장기 목표 최적화
단계가 많은 작업을 완수하도록 모델을 설계하고 보상하는 접근으로, 단일 지시보다 최종 목표 달성에 더 큰 가중치를 부여한다. 입력된 지시와 모델이 학습된 우선순위가 충돌하면 최종 보상 기준에 맞춘 행동을 선택할 가능성이 커진다. 자동화된 의사결정과 자율적 작업 수행을 중시하는 응용에서 채택되는 특성이다.