샘플 복잡도
주어진 신뢰도와 정확도를 달성하기 위해 요구되는 환경 상호작용 수로 정의되는 수치적 자원이다. 강화학습에서는 에피소드 수 또는 프레임 수로 측정되며 저데이터(예: 100K)와 고데이터(예: 200M) regime를 가르는 기준으로 사용된다. 본 논문은 서로 다른 샘플 복잡도 구간에서 알고리즘 순위가 뒤바뀌는 현상을 이 개념으로 분석한다.