부분 관찰 MDP
부분 관찰 MDP는 에이전트가 완전한 환경 상태를 관찰하지 못할 때 상태 확률분포를 기반으로 의사결정을 수행하는 수학적 모델이다. 원문에서 이 구조는 관찰 가능한 상태를 노드로, 행동을 엣지로 매핑하고 엣지에 성공확률·토큰비용·결과를 가중치로 부여하는 방식으로 구현됐음이 확인됐다. 그러므로 에이전트는 그래프를 탐색해 성능 데이터를 수집하고 그 데이터를 바탕으로 탐험 후 활용(exploit)을 수행했다고 기술됐다.