심층 Q-네트워크
강화학습 알고리즘 중 하나로, 신경망을 사용하여 각 행동의 가치를 예측하고 최적의 정책을 학습한다. 여기서는 추론된 상대 상태를 바탕으로 최적의 주행 및 에너지 사용 결정을 내리는 데 쓰인다.