챕터별 상세
00:00
POMDP 해결의 어려움과 근사법의 필요성
POMDP는 상태를 직접 관측할 수 없어 신념 상태(Belief State)라는 확률 분포 위에서 계획을 세워야 한다. 정확한 해법인 가치 반복법(Value Iteration)은 알파 벡터의 수가 지수적으로 증가하여 중간 규모의 문제조차 해결하기 어렵다. 따라서 실무에서는 오프라인에서 미리 정책을 계산해두는 근사 해법이 필수적이다.
05:00
QMDP 알고리즘의 원리와 한계
QMDP는 가장 단순한 POMDP 근사법 중 하나로, 다음 단계에서 상태를 완전히 알 수 있게 된다고 가정한다. MDP의 최적 Q-가치를 계산한 뒤, 현재 신념 상태를 가중치로 사용하여 기대 가치를 합산한다. 구현이 매우 쉽고 효율적이지만, 정보를 얻기 위한 행동(Information Gathering)의 가치를 전혀 고려하지 못한다는 치명적인 단점이 있다.
python
def qmdp_policy(belief, q_values):
# belief: states에 대한 확률 분포
# q_values: 미리 계산된 MDP의 Q-가치
action_values = {}
for a in actions:
# 각 행동에 대해 신념 상태와 Q-가치의 가중 평균 계산
action_values[a] = sum(belief[s] * q_values[s, a] for s in states)
return max(action_values, key=action_values.get)QMDP 알고리즘에서 현재 신념 상태를 바탕으로 최적의 행동을 선택하는 로직이다.
34:00
Fast Informed Bound (FIB)를 통한 상한선 개선
FIB는 QMDP보다 더 정교하게 가치 함수의 상한(Upper Bound)을 추정하는 기법이다. QMDP가 관측 모델을 무시하는 것과 달리, FIB는 관측 확률을 계산 과정에 포함시켜 다음 단계의 불확실성을 일부 반영한다. 이를 통해 QMDP보다 더 타이트한 상한선을 제공하며, 계산 복잡도는 관측값의 수에 비례하여 증가한다.
38:00
Point-Based Value Iteration (PBVI)의 메커니즘
PBVI는 전체 신념 공간 대신 선택된 유한한 신념 포인트 세트에서만 가치 함수를 업데이트한다. 각 포인트에서 백업(Backup) 연산을 수행하여 해당 지점의 가치를 개선하는 새로운 알파 벡터를 생성한다. 이 방식은 가치 함수의 하한(Lower Bound)을 보장하며, 포인트의 수가 늘어날수록 최적해에 수렴하는 특성을 가진다.
python
def backup(belief_point, alpha_vectors):
# 각 행동에 대해 새로운 알파 벡터 생성
best_alphas = []
for a in actions:
# 관측값에 따른 미래 신념 상태에서 가장 좋은 알파 벡터 선택
# ... (중략)
new_alpha_a = reward_vector(a) + gamma * expected_future_value
best_alphas.append(new_alpha_a)
# 신념 포인트에서 가치를 최대화하는 벡터 반환
return max(best_alphas, key=lambda alpha: dot(alpha, belief_point))PBVI에서 특정 신념 포인트에 대해 가치 함수를 업데이트하는 백업 연산 과정이다.
64:00
효율적인 신념 포인트 확장 전략
PBVI의 성능은 신념 포인트를 얼마나 잘 선택하느냐에 좌우된다. 무작위 확장(Random Expansion)은 현재 포인트에서 가능한 모든 행동과 관측을 시뮬레이션하여 새로운 포인트를 추가한다. 탐색적 확장(Exploratory Expansion)은 기존 포인트들과 가장 멀리 떨어진 도달 가능한 신념 상태를 선택하여 신념 공간을 더 넓게 커버하도록 유도한다.
용어 해설
- 부분 관측 마르코프 결정 과정(POMDP)
- — 에이전트가 현재 상태를 정확히 알 수 없고 노이즈가 섞인 관측값만 얻을 수 있는 환경에서 최적의 행동을 결정하기 위한 수학적 프레임워크이다. 상태 전이의 불확실성과 관측의 불확실성을 모두 고려하여 의사결정을 수행한다.
- 신념 상태(Belief State)
- — 에이전트가 과거의 행동과 관측 이력을 바탕으로 현재 어떤 상태에 있을지에 대해 계산한 확률 분포이다. POMDP에서는 실제 상태 대신 이 신념 상태를 의사결정의 기준으로 사용한다.
- 알파 벡터(Alpha Vector)
- — POMDP의 가치 함수를 조각별 선형 및 볼록 함수로 표현할 때 사용하는 벡터이다. 각 벡터는 특정 행동에 대한 기대 효용을 나타내며, 신념 상태와의 내적을 통해 해당 지점의 가치를 계산한다.
- 백업 연산(Backup Operation)
- — 현재의 가치 함수 추정치를 바탕으로 한 단계 미래를 예측하여 더 정확한 새로운 가치 함수(알파 벡터)를 계산하는 과정이다. 벨만 방정식을 신념 상태 공간으로 확장하여 적용한 형태이다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 02. 25.수집 2026. 02. 25.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

