TL;DR
Danijar Hafner는 AI가 학습 중 접하지 않은 환경에서도 행동하도록 만드는 Model-Based Reinforcement Learning 연구를 바탕으로 로봇 기술을 개발하고 있습니다. 그의 방식은 물리적 현실을 모사하는 World Model 안에서 Agent를 학습시키고, Agent가 미래 결과를 예측하며 행동 계획을 세우도록 구성됩니다. PlaNet과 Dreamer 계열은 Atari 2600과 Minecraft에서 성과를 냈고, Dreamer 4는 게임과 직접 상호작용하지 않은 채 기록 영상만으로 다이아몬드 채굴을 학습했습니다. Hafner는 2025년 가을 Google DeepMind를 떠나 이 기술을 인간의 생활공간에서 작동하는 휴머노이드 로봇으로 확장하는 비공개 스타트업을 시작했습니다.
섹션별 상세
용어 해설
- 모델 기반 강화학습(Model-Based Reinforcement Learning)
- — 환경과 행동의 결과를 예측하는 World Model을 먼저 학습한 뒤, 그 내부에서 Agent가 여러 행동을 시뮬레이션하며 정책을 익히는 강화학습 방식입니다. 실제 환경에서 반복 시행착오를 줄이고, 학습 데이터에 없던 상황의 결과를 예측해 대응하는 데 중요합니다.
- 월드 모델(World Model)
- — 물리적 환경의 상태 변화와 행동 결과를 모사하는 AI 모델입니다. Agent는 월드 모델 안에서 행동을 실행하고 미래 상태를 예측하면서 실제 세계와 유사한 경험을 얻습니다. 로봇이 본 적 없는 공간을 탐색할 때 시행착오를 줄이는 기반이 됩니다.
- 에이전트(Agent)
- — 환경을 관찰하고 행동을 선택하는 학습 주체입니다. 이 기사에서는 Agent가 World Model 내부에서 미래 결과를 예측하고 행동 계획을 세운 뒤, 그 경험을 실제 로봇 제어에 활용합니다. 로봇에 탑재되면 낯선 공간에서 상황에 맞춰 움직이는 역할을 맡습니다.
- 오프라인 강화학습(Offline Reinforcement Learning)
- — Agent가 실제 환경과 직접 상호작용하지 않고 미리 기록된 행동 데이터만으로 학습하는 방식입니다. Dreamer 4는 게임 플레이 영상 데이터에서 World Model을 학습하고 다이아몬드 채굴 행동을 익혔습니다. 실제 로봇의 위험한 시행착오를 줄일 수 있다는 점에서 물리 환경 적용과 연결됩니다.
기술
- Model-Based Reinforcement Learning
- World Model
- PlaNet
- Dreamer 2
- Dreamer 3
- Dreamer 4
- DayDreamer
- Atari 2600
- Minecraft
- transformer
활용 사례
- 낯선 집 구조와 가구 배치에 대응하는 가정용 휴머노이드 로봇
- 실제 환경에서 시행착오를 줄이는 로봇 제어
- 기록된 게임 플레이 영상만 활용하는 오프라인 강화학습
- 새로운 물리적 상황에 반응하는 자율 로봇
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




