TL;DR
이 강의는 월드 모델의 기초를 다룬다. 에이전트와 환경 간의 상호작용 루프를 정의하고, 완전한 진실인 상태(State)와 부분적인 스냅샷인 관측(Observation)을 구분한다. 월드 모델은 환경의 대리자로서 다음 상태를 예측하는 신경망이며, 렌더러, 시뮬레이터, 플래너라는 세 가지 기능적 분류를 통해 정의된다. 1943년 케네스 크레이크의 개념부터 2018년 하와 슈미트후버의 연구까지 월드 모델의 발전 과정을 짚어보며, 현대 AI에서의 역할을 조명한다.
챕터별 상세
에이전트-환경 인터페이스
강화학습의 기본 구조를 설명한다.
상태와 관측의 구분
현실 세계의 정보는 대부분 부분적으로만 관측 가능하다.
월드 모델의 정의
월드 모델의 역사
오래된 개념이 컴퓨팅 파워의 발전으로 실현되고 있다.
월드 모델의 분류: 렌더러, 시뮬레이터, 플래너
논문마다 다른 월드 모델의 정의를 이 분류로 정리할 수 있다.
용어 해설
- 에이전트-환경 인터페이스(Agent-Environment Interface)
- — 에이전트가 환경과 상호작용하는 기본 루프 구조이다. 에이전트는 행동(Action)을 취하고, 환경은 상태(State)를 업데이트하며, 에이전트는 관측(Observation)을 받아 다음 행동을 결정한다.
- 부분 관측 마르코프 결정 과정(POMDP)
- — 에이전트가 환경의 전체 상태를 직접 관측하지 못하고 부분적인 정보만을 얻는 상황을 모델링하는 수학적 프레임워크이다. 대부분의 현실 세계 문제가 이에 해당한다.
- 칼만 필터(Kalman Filter)
- — 노이즈가 포함된 센서 데이터로부터 시스템의 실제 상태를 추정하는 알고리즘이다. 예측(Predict)과 보정(Correct) 과정을 반복하여 상태를 최적화한다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




