본문으로 건너뛰기
sudoremove조회 1

General Intuition의 MIRA 월드 모델과 Decart의 실시간 추론 분석

General Intuition의 MIRA 월드 모델 구조와 Decart의 실시간 운전 시뮬레이션 API 및 비즈니스 전략 분석.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

General Intuition이 공개한 MIRA는 5B 파라미터 규모의 월드 모델로, Rocket League 게임 화면 4개를 동시에 생성하며 B200 GPU 한 장에서 20Hz의 추론 속도를 구현한다. 이 모델은 Diffusion Forcing 기법을 통해 Mode Collapse 문제를 해결하고 4초의 컨텍스트 윈도우를 제공하며, 단순한 월드 모델을 넘어 내비게이션 에이전트 학습을 위한 환경으로 설계되었다. 한편, 40억 달러 가치의 Decart는 실시간 월드 모델 API를 초당 0.02달러에 제공하며 클라우드 기반 추론 시장을 공략한다. 두 기업 모두 월드 모델을 단순 생성 도구가 아닌 에이전트 지능의 핵심 훈련장으로 활용하는 데 집중하고 있다.

챕터별 상세

00:00

General Intuition과 OpenAI의 5억 달러 제안

General Intuition은 Medal에서 스핀오프한 기업으로, OpenAI의 5억 달러 인수 제안을 거절하고 독자적인 월드 모델 개발을 선택했다. 이들은 월드 모델을 단순한 생성 도구가 아닌 에이전트 학습을 위한 훈련장으로 정의한다.
00:40

MIRA World Model, ICML 현장 플레이

MIRA는 ICML에서 공개된 월드 모델로, Rocket League 게임 화면을 실시간으로 생성한다. 현장에서 직접 조이스틱으로 플레이하며 모델이 생성하는 화면의 반응성을 확인했다.
01:58

한 모델이 4개 프레임 동시 생성

MIRA는 하나의 모델이 4개의 게임 프레임을 동시에 생성하는 구조를 갖췄다. 각각의 프레임은 서로 다른 뷰포인트를 가지며, 일관된 물리 법칙을 공유한다.
02:59

MIRA 모델 구조와 20Hz 출력

MIRA는 Codec Encoder를 통해 레이턴트를 변환하고, Diffusion Forcing을 적용하여 20Hz의 출력 속도를 달성했다. B200 GPU 한 장에서 5B 파라미터 모델이 실시간 추론을 수행한다.
03:28

Mode Collapse와 Diffusion Forcing

월드 모델은 잘못된 프레임을 생성하면 오차가 누적되는 문제가 발생한다. MIRA는 Diffusion Forcing을 통해 노이즈가 섞인 상태에서도 일관된 시퀀스를 생성하여 Mode Collapse를 방지한다.
05:18

Context Window 4초

MIRA의 컨텍스트 윈도우는 4초로, 이전 프레임의 정보를 유지하며 미래 상태를 예측한다. 4초라는 제한된 시간 내에서 물리적 일관성을 유지하는 것이 핵심이다.
06:08

World Model은 훈련장, 목표는 에이전트

General Intuition은 월드 모델 자체보다 이를 활용한 내비게이션 에이전트 개발에 더 큰 관심을 두고 있다. 월드 모델은 에이전트가 다양한 상황을 학습할 수 있는 시뮬레이션 환경 역할을 한다.
10:15

ALOHA 뷰포인트와 MIRA

ALOHA 로봇의 다각도 카메라 뷰포인트와 MIRA의 4분할 화면 구조는 유사한 데이터 처리 방식을 공유한다. 여러 시점을 동시에 처리하는 것은 에이전트의 공간 인지 능력을 높이는 데 기여한다.
11:14

Decart와 홍콩 운전 데모

Decart는 40억 달러 가치를 인정받은 기업으로, 실시간 운전 시뮬레이션 데모를 공개했다. 사용자가 직접 차량을 제어하며 실시간으로 변화하는 환경을 경험할 수 있다.
13:25

API 0.02달러와 World Model 클라우드 인퍼런스

Decart는 실시간 월드 모델 API를 초당 0.02달러에 제공한다. 클라우드 인퍼런스를 통해 고성능 하드웨어 없이도 월드 모델을 활용할 수 있는 환경을 구축했다.

용어 해설

월드 모델(World Model)
환경의 물리적 법칙과 역학을 학습하여 미래 상태를 예측하는 AI 모델. 단순히 텍스트를 생성하는 LLM과 달리, 시각적·공간적 환경 내에서 객체의 움직임과 상호작용을 시뮬레이션하는 데 특화되어 있다.
디퓨전 포싱(Diffusion Forcing)
노이즈가 섞인 상태에서도 일관된 시퀀스를 생성하기 위해 모델 내부에서 디퓨전 과정을 활용하는 학습 기법. 생성 과정에서 오차가 누적되어 발생하는 Mode Collapse 문제를 완화하고 긴 시퀀스 생성의 안정성을 높인다.
모드 붕괴(Mode Collapse)
생성 모델이 학습 데이터의 다양한 분포를 반영하지 못하고 특정 패턴이나 결과물만 반복적으로 생성하는 현상. 월드 모델에서는 환경의 다양성을 잃고 정적인 화면만 출력하는 문제로 나타난다.
컨텍스트 윈도우(Context Window)
모델이 한 번에 처리하거나 기억할 수 있는 입력 데이터의 범위. 월드 모델에서는 이전 프레임들의 정보를 유지하여 다음 상태를 예측하는 데 사용되는 시간적 범위를 의미한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 22.수집 2026. 07. 22.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.