확률적 밴딧
각 행동의 보상이 확률분포에서 샘플되는 상황에서 반복적으로 행동을 선택해 누적 보상을 최대화하는 문제로, 관측 비용이 존재하면 관측 여부 결정이 탐색-활용 균형에 직접적인 영향을 미친다.