본문으로 건너뛰기

스탠퍼드 CS221: 강화학습 II - 함수 근사와 정책 경사 알고리즘

대규모 상태 공간 문제를 해결하기 위한 함수 근사 기법과 정책 경사 알고리즘의 수학적 원리 및 PyTorch 구현 방법을 심도 있게 다룬다.

챕터별 상세

00:00

강화학습 기초 및 가치 기반 모델 복습

강화학습의 기본 설정인 Agent와 Environment 간의 상호작용 및 MDP 프레임워크를 재검토했다. Q-learning, SARSA, Monte Carlo 등 지난 강의에서 다룬 모델 프리 기법들의 업데이트 규칙과 차이점을 정리했다. 특히 각 상태-행동 쌍에 대해 값을 저장하는 테이블 기반 방식의 구조를 확인했다.

강화학습의 기본 요소인 상태(State), 행동(Action), 보상(Reward) 및 Q-value의 개념을 미리 숙지해야 한다.

17:00

함수 근사(Function Approximation)의 도입

이미지나 문장과 같이 상태 공간이 무한에 가까운 실제 문제에서는 테이블 기반 방식을 사용할 수 없음을 지적했다. 이를 해결하기 위해 상태를 피처 벡터로 변환하고 파라미터화된 함수를 통해 Q-value를 예측하는 Function Approximation 기법을 도입했다. 선형 모델이나 신경망을 활용하여 유사한 상태에 대한 가치를 일반화할 수 있는 구조를 설계했다.

차원의 저주(Curse of Dimensionality)로 인해 발생하는 테이블 기반 방식의 한계를 이해하는 것이 중요하다.

24:00

PyTorch를 이용한 파라미터화된 Q-learning 구현

신경망을 활용한 Q-learning의 업데이트 과정을 코드로 구현했다. 예측값과 타겟값 사이의 Squared Loss를 정의하고, 역전파를 통해 모델의 파라미터를 업데이트하는 과정을 시연했다. 타겟값은 즉각적인 보상과 다음 상태의 예상 가치를 합산한 Bootstrapping 방식으로 계산했다.

PyTorch의 자동 미분 기능과 강화학습의 벨만 방정식을 결합하는 논리를 파악해야 한다.

42:00

정책 경사(Policy Gradient) 알고리즘의 원리

가치 함수를 거치지 않고 정책을 직접 최적화하는 Policy-based 방식의 장점을 논의했다. 기대 효용(Expected Utility)을 최대화하기 위해 정책 파라미터에 대한 경사도를 계산하는 수학적 유도 과정을 상세히 다뤘다. 이를 통해 보상이 높은 궤적(Trajectory)의 발생 확률을 높이는 REINFORCE 알고리즘의 구조를 도출했다.

로그 확률의 미분 성질을 이용한 Policy Gradient Theorem의 유도 과정을 이해해야 한다.

61:00

분산 감소를 위한 Baseline 및 Actor-Critic 기법

Policy Gradient의 높은 분산 문제를 해결하기 위해 Baseline을 도입하는 방법을 다뤘다. 상태에만 의존하는 함수를 보상에서 차감함으로써 경사도의 기댓값은 유지하면서 분산을 획기적으로 줄일 수 있음을 증명했다. 더 나아가 가치 함수와 정책을 동시에 학습하는 Actor-Critic 구조로 확장하여 학습의 효율성을 극대화했다.

통계적 분산이 강화학습의 수렴 속도와 안정성에 미치는 영향을 이해해야 한다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 10.수집 2026. 03. 10.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.