TL;DR
본 강의는 월드 모델을 구축하기 위한 4가지 핵심 툴킷인 압축, 보상, 가치, 행동 학습 정책을 설명한다. 인코더를 통해 고차원 데이터를 잠재 공간으로 압축하여 효율적인 예측을 가능하게 하고, 강화학습의 보상과 가치 개념을 통해 에이전트가 미래의 누적 보상을 최대화하는 최적의 행동을 선택하도록 돕는다. 특히 액터-크리틱 구조를 통해 에이전트가 제안한 행동을 크리틱이 평가하며 정책을 개선하는 과정을 다루며, 이를 통해 에이전트가 실제 환경에 배포되기 전 시뮬레이션 환경에서 학습할 수 있음을 강조한다.
챕터별 상세
월드 모델 툴킷 개요
지난 강의 복습 및 에이전트-환경 인터페이스
POMDP(Partially Observable Markov Decision Process): 에이전트가 환경의 전체 상태를 알 수 없고 일부 정보만 관측 가능한 상황.
툴킷의 4가지 핵심 요소
압축과 잠재 공간의 이해
오토인코더(Autoencoder): 데이터를 압축하는 인코더와 복원하는 디코더로 구성된 신경망 구조.
잠재 공간의 의미와 활용
보상과 가치, 그리고 할인 계수
할인 계수(gamma): 0과 1 사이의 값으로, 미래 보상을 현재 가치로 환산할 때 사용.
크레딧 할당 문제와 플래너
Q-함수: 특정 상태에서 특정 행동을 했을 때 얻을 수 있는 기대 누적 보상.
가치 함수의 두 가지 유형
월드 모델과 가치 함수의 관계
행동 학습: Q-러닝과 액터-크리틱
액터-크리틱의 학습 원리
강의 요약 및 다음 단계
용어 해설
- 잠재 공간(Latent Space)
- — 고차원 데이터(이미지 등)를 저차원의 의미 있는 수치 벡터로 압축한 공간. 원본 데이터의 핵심 특징을 보존하며, 모델이 복잡한 환경을 효율적으로 이해하고 예측하는 데 사용된다.
- 강화학습(Reinforcement Learning)
- — 에이전트가 환경과 상호작용하며 보상을 최대화하는 행동 방식을 학습하는 기계학습 분야. 본 강의에서는 에이전트가 미래의 누적 보상을 예측하고 최적의 행동을 선택하는 메커니즘으로 다뤄진다.
- 액터-크리틱(Actor-Critic)
- — 행동을 결정하는 '액터'와 그 행동의 가치를 평가하는 '크리틱'으로 구성된 강화학습 구조. 액터는 크리틱의 피드백을 통해 더 나은 행동을 학습하고, 크리틱은 액터의 행동을 평가하며 정책을 개선한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




