본문으로 건너뛰기
HF Daily Papers조회 1

Matrix-Game 3.0: 장기 기억력을 갖춘 실시간 스트리밍 대화형 세계 모델

기존의 비디오 생성 모델은 긴 시간 동안 일관성을 유지하기 어렵거나 실시간 상호작용이 불가능한 한계가 있었다. 이 논문은 Unreal Engine 기반의 대규모 데이터 엔진과 메모리 증강 기술을 통해 720p 고해상도 영상을 실시간(40 FPS)으로 생성하면서도 분 단위의 긴 시간 동안 일관된 세계를 유지하는 방법을 제시한다.

용어 해설

세계 모델(World Model)
환경의 물리적 법칙과 인과 관계를 시뮬레이션하여 미래의 상태를 예측하는 AI 모델이다. 에이전트가 실제 환경에서 행동하기 전에 가상 세계에서 결과를 미리 시뮬레이션함으로써 효율적인 학습과 계획 수립을 가능하게 한다.
디퓨전 트랜스포머(DiT)
기존의 U-Net 구조 대신 Transformer 아키텍처를 Diffusion 모델의 백본으로 사용하는 구조이다. 데이터의 확장성이 뛰어나 고해상도 이미지 및 비디오 생성에서 뛰어난 성능을 보이며, 최근 Sora 등 최신 영상 생성 모델의 핵심 기술로 자리 잡았다.
분포 매칭 증류(DMD)
복잡한 다단계 Diffusion 과정을 단 몇 단계의 추론으로 압축하는 증류 기법이다. 생성된 데이터의 분포를 실제 데이터 분포와 일치시키도록 학습하여, 실시간 수준의 빠른 생성 속도와 높은 품질을 동시에 확보하는 데 사용된다.
시공간적 일관성(Spatiotemporal Consistency)
비디오 생성에서 프레임 간의 공간적 구조(객체의 형태, 위치)와 시간적 흐름(움직임의 자연스러움)이 어긋나지 않고 유지되는 성질이다. 긴 시간 동안 영상이 뭉개지거나 갑자기 변하지 않도록 유지하는 것이 세계 모델의 핵심 과제이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 10.수집 2026. 04. 14.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.