상태-행동 가치 분포
한 상태와 행동에서 얻을 수 있는 누적 보상의 확률 분포를 의미하며 분포 기반 방법들은 이 전체 분포를 학습하려 한다. 분포를 정확히 학습하려면 더 많은 샘플이 필요하며 지원이 알려진 경우와 모르는 경우의 샘플 복잡도 차이가 본문에서 이슈가 된다. C51, QR-DQN, IQN 같은 분포형 알고리즘은 이 개념을 직접적으로 학습하는 예다.