본문으로 건너뛰기

낯선 환경을 학습하는 로봇 AI

Danijar Hafner는 World Model 속 경험으로 낯선 환경에 대응하는 로봇 AI를 개발하고 있습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Danijar Hafner는 AI가 학습 중 접하지 않은 환경에서도 행동하도록 만드는 Model-Based Reinforcement Learning 연구를 바탕으로 로봇 기술을 개발하고 있습니다. 그의 방식은 물리적 현실을 모사하는 World Model 안에서 Agent를 학습시키고, Agent가 미래 결과를 예측하며 행동 계획을 세우도록 구성됩니다. PlaNet과 Dreamer 계열은 Atari 2600과 Minecraft에서 성과를 냈고, Dreamer 4는 게임과 직접 상호작용하지 않은 채 기록 영상만으로 다이아몬드 채굴을 학습했습니다. Hafner는 2025년 가을 Google DeepMind를 떠나 이 기술을 인간의 생활공간에서 작동하는 휴머노이드 로봇으로 확장하는 비공개 스타트업을 시작했습니다.

섹션별 상세

01
Danijar Hafner의 새 스타트업은 학습 때 접하지 않은 환경에서도 AI가 움직이도록 만드는 연구를 휴머노이드 로봇으로 확장하고 있습니다. 사람이 사는 집에 로봇을 보내려면 학습 데이터에 없는 평면 구조와 가구 배치에도 대응해야 하므로, 실제 환경의 사전 정의보다 새로운 상황에 대한 예측 능력이 중요합니다. Hafner는 중국에서 들여온 여러 형태의 휴머노이드를 이 연구의 물리적 구현으로 활용하고 있습니다.
02
Hafner의 핵심 방식은 물리적 현실을 모사하는 World Model을 만들고 그 안에서 Agent를 학습시키는 Model-Based Reinforcement Learning입니다. Agent는 World Model을 실제 세계와 유사한 시뮬레이션으로 취급해 행동을 실행하고, 그 결과를 이용해 앞으로 일어날 상태를 예측하며 행동 계획을 세웁니다. 이 구조는 로봇이 실제 공간에서 모든 행동을 시행착오로 시험하지 않고도 낯선 상황에 대응하도록 만드는 기반입니다.
03
Hafner는 World Model 접근법을 게임 환경에서 단계적으로 검증했습니다. PlaNet은 미래 행동을 계획하는 Agent를 구현했고, Dreamer 2는 World Model을 사용해 Atari 2600에서 인간 수준의 성능에 도달했으며, Dreamer 3는 Minecraft에서 스스로 다이아몬드를 채굴했습니다. Dreamer 4는 게임과 직접 상호작용하지 않고 기록된 게임 플레이 영상으로 학습해 다이아몬드 채굴을 수행하면서 오프라인 데이터만으로 행동을 익히는 단계까지 나아갔습니다.
04
가상 환경에서 검증한 알고리즘은 DayDreamer를 통해 실제 로봇으로 옮겨졌습니다. DayDreamer는 로봇이 새로운 환경에서 스스로 작동하고, 특정 상황에 대한 별도 훈련 없이 밀려 넘어지는 등 새로운 경험에 반응하도록 구성됐습니다. Hafner는 2025년 가을 Google DeepMind를 떠나 새 스타트업을 세웠으며, 현재는 이름과 구체적인 사업 내용을 공개하지 않은 채 이 기술을 인간의 생활공간에 적용하는 방향을 추진하고 있습니다.

용어 해설

모델 기반 강화학습(Model-Based Reinforcement Learning)
환경과 행동의 결과를 예측하는 World Model을 먼저 학습한 뒤, 그 내부에서 Agent가 여러 행동을 시뮬레이션하며 정책을 익히는 강화학습 방식입니다. 실제 환경에서 반복 시행착오를 줄이고, 학습 데이터에 없던 상황의 결과를 예측해 대응하는 데 중요합니다.
월드 모델(World Model)
물리적 환경의 상태 변화와 행동 결과를 모사하는 AI 모델입니다. Agent는 월드 모델 안에서 행동을 실행하고 미래 상태를 예측하면서 실제 세계와 유사한 경험을 얻습니다. 로봇이 본 적 없는 공간을 탐색할 때 시행착오를 줄이는 기반이 됩니다.
에이전트(Agent)
환경을 관찰하고 행동을 선택하는 학습 주체입니다. 이 기사에서는 Agent가 World Model 내부에서 미래 결과를 예측하고 행동 계획을 세운 뒤, 그 경험을 실제 로봇 제어에 활용합니다. 로봇에 탑재되면 낯선 공간에서 상황에 맞춰 움직이는 역할을 맡습니다.
오프라인 강화학습(Offline Reinforcement Learning)
Agent가 실제 환경과 직접 상호작용하지 않고 미리 기록된 행동 데이터만으로 학습하는 방식입니다. Dreamer 4는 게임 플레이 영상 데이터에서 World Model을 학습하고 다이아몬드 채굴 행동을 익혔습니다. 실제 로봇의 위험한 시행착오를 줄일 수 있다는 점에서 물리 환경 적용과 연결됩니다.

기술

  • Model-Based Reinforcement Learning
  • World Model
  • PlaNet
  • Dreamer 2
  • Dreamer 3
  • Dreamer 4
  • DayDreamer
  • Atari 2600
  • Minecraft
  • transformer

활용 사례

  • 낯선 집 구조와 가구 배치에 대응하는 가정용 휴머노이드 로봇
  • 실제 환경에서 시행착오를 줄이는 로봇 제어
  • 기록된 게임 플레이 영상만 활용하는 오프라인 강화학습
  • 새로운 물리적 상황에 반응하는 자율 로봇
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 08.수집 2026. 09. 08.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.