본문으로 건너뛰기

Solaris: 마인크래프트에서의 멀티플레이어 비디오 월드 모델 구축

기존 비디오 월드 모델은 1인칭 시점에 국한되어 다수의 에이전트가 상호작용하는 복잡한 환경을 모사하지 못했다. Solaris는 여러 플레이어의 시점을 동시에 생성하고 일관성을 유지함으로써, AI 에이전트가 타인의 행동을 이해하고 협력하는 능력을 학습할 수 있는 가상 환경을 제공한다.

용어 해설

월드 모델(World Model)
에이전트가 환경 내에서 자신의 행동에 따른 미래 상태를 예측하는 내부 시뮬레이션 모델이다. 과거 관측값과 행동을 입력받아 다음 장면을 생성함으로써 에이전트의 계획 수립과 학습을 돕는 가상 환경 역할을 수행한다.
셀프 포싱(Self Forcing)
모델이 학습 중에 실제 정답 데이터뿐만 아니라 자신이 직접 생성한 데이터를 다시 입력으로 사용하여 학습하는 기법이다. 학습 시의 정답 강제(Teacher Forcing)와 추론 시의 자기 회귀 생성 사이의 괴리를 줄여 장기적인 비디오 생성 안정성을 높인다.
확산 트랜스포머(DiT)
Diffusion 모델의 아키텍처로 기존의 U-Net 대신 Transformer 구조를 사용하는 방식이다. 데이터의 패치화와 Self-Attention을 통해 고해상도 이미지나 비디오 생성에서 뛰어난 확장성과 성능을 보여준다.
자기회귀 생성(Autoregressive Generation)
이전에 생성된 결과를 다음 단계의 입력으로 사용하여 순차적으로 데이터를 만들어가는 방식이다. 비디오 생성에서는 앞선 프레임들을 바탕으로 다음 프레임을 예측하며 시퀀스를 이어가며, 데이터 간의 시간적 연속성을 보장한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 26.수집 2026. 02. 27.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.