TL;DR
AlayaWorld는 수작업으로 자산을 제작하는 전통적 게임 파이프라인을 대체해 텍스트·이미지·비디오 입력만으로 즉시 탐험 가능한 가상 세계를 생성하는 방법을 제시한다. 이 모델은 상호작용성, 장기 일관성, 긴 롤아웃 안정성, 실시간성이라는 네 가지 난제를 동시에 만족하도록 설계되어 인터랙티브 시나리오에서 기존 비디오 생성기의 한계를 메우는 실용적 기반을 제공한다. 또한 4스텝 증류를 통해 실시간 응답이 가능한 수준으로 추론 비용을 낮추어 인터랙티브 애플리케이션으로의 실제 적용 가능성을 높였다.
왜 중요한가
AlayaWorld는 수작업으로 자산을 제작하는 전통적 게임 파이프라인을 대체해 텍스트·이미지·비디오 입력만으로 즉시 탐험 가능한 가상 세계를 생성하는 방법을 제시한다. 이 모델은 상호작용성, 장기 일관성, 긴 롤아웃 안정성, 실시간성이라는 네 가지 난제를 동시에 만족하도록 설계되어 인터랙티브 시나리오에서 기존 비디오 생성기의 한계를 메우는 실용적 기반을 제공한다. 또한 4스텝 증류를 통해 실시간 응답이 가능한 수준으로 추론 비용을 낮추어 인터랙티브 애플리케이션으로의 실제 적용 가능성을 높였다.
핵심 기여
유한한 시각 컨텍스트 구성으로 장기 비용을 상수화한 생성 파이프라인
모델은 고정된 sink 프레임, 압축된 temporal history, geometry-aligned spatial memory, 그리고 최근 프레임 조건을 병합한 bounded visual context를 사용한다. 이 구조는 각 청크(chunk) 생성 시 요구되는 계산량을 입력 길이에 무관하게 거의 일정하게 유지한다. 그 결과 horizon이 이론적으로는 무제한이면서도 청크 단위로 일정한 비용으로 롤아웃할 수 있다.
지오메트리 정렬 기반의 공간 메모리와 최대 커버리지 선택
과거 생성 프레임과 Depth-Anything-3로 추정한 깊이를 키로 캐시하고 목표 카메라 뷰로 역투영하여 재사용한다. 프레임 선택은 z-buffer 기반의 occlusion 처리와 최대 커버리지 기준의 탐욕적 선택으로 최대 10개의 과거 프레임을 취합한다. 커버리지 마스크는 self-attention 키 바이어스로 사용되어 미관찰 영역을 신뢰하지 않도록 처리한다.
드리프트에 강한 학습을 위한 손상 이력과 오류 은행 기반의 anti-drift 전략
Helios drift simulation으로 잠재 공간의 잡음·블러·채도 변이를 합성하여 모델이 변형된 컨텍스트를 복원하도록 학습시킨다. 자체 롤아웃에서 발생한 복원 잔차(δ)를 에러 뱅크에 저장하고 재생해 실제 오류 분포에 노출시킴으로써 복원 능력을 실전 분포와 정렬시킨다. 이 두 기법은 오류가 누적되는 장기 autoregressive 롤아웃에서 시각적 흐림과 색상 변화 누적을 감소시켰다.
자동회귀 모델을 30스텝에서 4스텝으로 단축한 이산적 분포매칭 증류
교사-학생 구조에서 Distribution-Matching Distillation(DMD)을 사용해 학생이 교사 스코어 분포를 모방하도록 학습한다. 여기에 self-forcing++으로 학생이 자기 롤아웃에서 생성한 경로를 기준으로 점검하고 consistency distillation으로 서로 다른 노이즈 레벨 간 일관성을 강제하여 적은 샘플링 스텝에서도 밝기·경계 떨림을 억제했다. 학생 모델은 LoRA로 구현되어 본체를 고정한 채 4스텝 퍼청크로 실시간 대응이 가능하다.
다양한 도메인을 통합한 대규모 혼합 데이터 파이프라인과 시계열 정렬 캡션
코퍼스는 real-world captures와 synthetic renderings를 결합해 총 222,147 클립으로 구성되며, 소스별 문턱값 보정을 통해 품질을 균일화했다. 각 클립은 전역 속성과 세그먼트 수준의 시간 정렬 캡션(full_prompt, short_prompt)으로 주석 처리되어 시점·행동 제어 신호를 학습에 제공한다. 또한 파이프라인은 NVDEC/RAFT 기반의 피처 캐시와 단계별 필터를 사용해 대규모 전처리 비용을 줄였다.
핵심 아이디어 이해하기
문제를 시작점에서 바라보면, 비디오 생성에서 연속적인 시점 일관성을 유지하는 것은 과거 관측을 효과적으로 요약해 현재 생성에 반영하는 문제이다. 고전적 Transformer 기반 접근은 전체 과거를 무차별적으로 참조하면 컨텍스트 길이에 따라 연산·메모리 비용이 급격히 늘어나며, 롤아웃이 길어질수록 누적 오차가 시각적 드리프트로 증폭된다. 따라서 장기 상호작용을 지원하려면 과거 정보를 상수 비용으로 제공하면서도 재방문 시 기하학적 일관성을 복원할 수 있는 표현이 필요하다.
방법론
AlayaWorld는 VAE 잠재공간에서 청크 단위로 인과적으로 생성하는 구조를 채택했다. 각 청크는 K=4 latent 프레임 블록으로 취급되며, 청크 i의 입력으로는 sink, temporal memory, spatial memory, nearby frame이라는 네 스트림이 하나의 prefix 토큰 시퀀스로 병합되어 Transformer의 full self-attention에서 처리된다. 카메라 제어는 per-frame 상대 포즈의 Fourier 임베딩을 MLP로 처리한 후 AdaLN으로 토큰을 모듈레이션하는 방식으로 주입되어 패치 임베딩 구조를 변경하지 않고도 정확한 뷰 제어를 유지한다.
관련 Figure

이 도표는 논문이 사용한 7개 데이터 소스의 도메인 분포와 카메라 모션 특성을 동시에 보여줘 데이터 믹스가 학습된 패턴을 직관적으로 이해하게 한다. 실제 캡처와 합성 렌더링이 어떻게 상호보완되는지가 한 눈에 드러나며, 훈련 시 장면·모션 다양성을 확보한 이유를 뒷받침한다.
훈련 데이터 소스별 대표 샘플을 시간 순으로 배열해 각 소스의 카메라 모션과 도메인 차이를 시각화한 Figure이다.

이 다이어그램은 각 청크 생성 단계에서 어떤 입력이 준비되고 Transformer에 어떻게 공급되는지 구조적으로 보여준다. 특히 spatial memory가 선택·역투영·렌더링되어 VAE 인코더로 들어가는 흐름과 prefix 토큰의 절삭 후 목표 세그먼드만 디노이징하는 처리 과정이 명확히 드러나므로 방법론의 핵심 동작을 이해하는 데 결정적이다.
청크 기반 오토리그레시브 생성 파이프라인과 bounded context 구성요소(sink, temporal memory, spatial memory, nearby) 및 spatial memory의 렌더링 흐름을 정리한 아키텍처 다이어그램이다.

이 그림은 손상된 과거 컨텍스트를 모델이 복구하는 사례와 에러 뱅크 재생을 통해 실제 롤아웃 오류에 적응한 사례를 나란히 보여준다. 시각적 결과는 anti-drift 학습 전략이 장기 안정성에 기여했다는 경험적 근거를 제공한다.
Helios drift simulation과 error bank 등 드리프트 완화 기법의 영향으로 장기 롤아웃에서 발생하는 시각적 열화가 억제된 사례를 비교한 Figure이다.
주요 결과
정량평가에서 AlayaWorld는 iWorld-Bench의 여러 지표에서 최고 성능을 기록했다. 구체적으로 Brightness Consistency 0.9492와 Color Temp. Constraint 0.9379, Sharpness Retention 0.8361을 달성해 장기 드리프트와 조명 변화 억제에서 큰 이득을 보였다. Trajectory Accuracy는 0.7985, Memory Symmetry는 0.8871로 경로 추종과 재방문 시 시각적 일관성 측면에서도 우수한 성능을 보였다.
관련 Figure

이 그림은 AlayaWorld가 텍스트·이미지·비디오 입력에 대해 다양한 장면 스타일과 이벤트를 생성할 수 있음을 시각적으로 보여준다. 샘플들은 서로 다른 카메라 모션과 이벤트 삽입 사례를 포함하여 모델의 다중 입력 제어 능력과 prompt-driven 행동 반응을 보강한다.
다양한 장면에서의 인터랙티브 월드 생성 결과를 모자이크 형식으로 제시한 Figure로, 생성된 샘플의 장르·스타일 분포와 인터랙티브 예시를 한눈에 파악할 수 있다.

이 Figure는 연속적인 카메라 궤적과 청크 경계에서 prompt를 전환했을 때 생성물이 어떻게 자연스럽게 이어지는지를 보여준다. 결과는 AdaLN 기반 카메라 제어와 prefix 기반 컨디셔닝이 연속성 유지에 실질적 기여를 했음을 시사한다.
카메라 제어와 prompt 스위칭에 따른 생성 예시를 시간 축으로 정렬해 보여주는 Figure로서, 제어 신호에 따른 장면 변화의 연속성을 강조한다.

이 모음은 서로 다른 장면과 상호작용 시나리오에서 모델이 보이는 행동 패턴을 종합적으로 요약한다. 특히 재방문 시 동일한 객체와 구조가 유지되는 사례가 포함되어 spatial memory와 압축 히스토리의 결합 효과를 시각적으로 보강한다.
정성적 결과 모음으로서 카메라 제어, prompt-driven action, leave-and-return 재방문, 장기 롤아웃 안정성 등 논문이 주장하는 핵심 역량들을 예시로 집약한 Figure이다.
기술 상세
전체 아키텍처는 약 15B 파라미터의 video diffusion Transformer를 백본으로 사용하며 VAE 잠재공간에서 청크 단위로 인과적 생성을 수행한다. 한 청크는 K=4 latent 프레임으로 구성되고 각 청크 생성 시 입력 prefix S_i = [s (sink); h_i (temporal memory); g_i (spatial memory); n_i (nearby/I2V); z_i^τ (target)]가 Transformer에 제공된다. 카메라 제어는 per-frame 상대 포즈 Δπ를 Fourier 임베딩하고 MLP를 통해 얻은 출력으로 AdaLN의 scale과 shift를 보정하는 방식으로 통합된다.
관련 Figure

이 Figure는 교사 모델의 다중 샘플링 경로와 학생의 self-rollout 비교를 통해 distillation이 추론 단계에서 스텝 수를 줄이면서도 제어·메모리 스택을 유지하는 방법론적 근거를 제시한다. 또한 critic LoRA 토글을 통한 real/fake 스코어 구성과 two-timescale 업데이트가 어떻게 적용되는지 시각적 단서를 제공한다.
다단계 증류 과정과 self-forcing++를 포함한 DMD 기반의 4스텝 학생으로 가속한 추론 성능을 예시적으로 보여주는 Figure이다.
한계점
논문은 시각 관측과 추정된 기하 정보에 기반해 장면을 표현하기 때문에 객체 내부 상태, 물리적 인과성의 숨은 변수, 그리고 장기적 과업 구조에 대한 심층적 이해 능력이 제한된다고 명시하고 있다. 이로 인해 보이는 단서로부터 직접 관측 가능한 변화는 잘 처리하지만 보이지 않는 내부 상태 추론이나 물리 시뮬레이션 수준의 정확도는 보장되지 않는다. 또한 소스 중 일부는 내부 큐레이션 데이터(MUGEN, GameVerse, GenEvent)를 포함하므로 공개 데이터만으로 동일한 성능을 재현하는 데 추가 작업이 필요할 수 있다.
실무 활용
AlayaWorld는 오픈소스 저장소와 데모 영상을 공개해 연구·프로토타이프 구축에 바로 활용 가능한 기반을 제공한다. 4스텝 증류로 실시간 상호작용 시나리오에 적합한 추론 지연을 확보했으며, camera-path와 chunk-level prompt를 입력으로 받아 즉시 제어 가능한 인터랙티브 월드 생성을 지원한다.
- 실험적 게임 프로토타입에서 텍스트·이미지 입력으로 빠르게 레벨과 이벤트를 생성하는 콘텐츠 파이프라인 통합
- 로봇 시뮬레이션에서 인간 조작자에 의한 시점 변화와 장기 상태 일관성이 요구되는 시나리오의 데이터 증강
- 시각적 스토리텔링 도구에서 사용자가 실시간으로 장면을 편집하고 즉시 결과를 확인하는 인터랙티브 제작 워크플로
- 교육·훈련 시뮬레이터에서 풍부한 환경 변화와 이벤트를 텍스트 프롬프트로 제어하는 시나리오 생성
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Spatial Memory
- — 생성된 과거 프레임과 해당 프레임의 깊이 및 카메라 포즈를 키-값 형식으로 저장하고 목표 뷰로 역투영하여 현재 생성에 재사용하는 구조로, 재방문 시 장면의 기하학적 일관성을 유지하는 데 사용된다. 선택된 과거 프레임은 최대 커버리지를 기준으로 골라 z-buffer 기반으로 합성되며, 미관찰 영역에는 attention bias가 적용되어 잘못된 대입을 방지한다. AlayaWorld에서는 최대 10프레임을 선택하고 occlusion tolerance δ=0.1을 적용해 공간 일관성을 확보한다.
- Distribution-Matching Distillation
- — 교사 모델의 스코어 분포를 학생 모델이 근사하도록 학습하는 증류 기법으로, 교사·비판(critic) 스코어의 차이를 이용해 학생 파라미터를 업데이트한다. AlayaWorld에서는 critic을 LoRA로 분리해 two-timescale 업데이트를 적용하고, self-forcing++와 consistency term을 결합해 30단계 샘플링을 4단계로 축소했다. 이 방식은 학생이 교사 분포를 모방하면서도 자기 롤아웃에서 발생하는 분포 이동을 견디도록 설계되었다.
- History Compression
- — 최근 L = 6 latent 프레임 윈도우를 경량 임베딩으로 압축해 Transformer의 입력 prefix로 주입하는 모듈로, 장기 정보를 대역폭 제한 하에서 유지한다. 입력 히스토리는 노이즈 섞기와 masking으로 견고화되어, 압축 임베딩이 누적 노이즈와 드리프트를 포함한 맥락에서도 유효하도록 학습된다. AlayaWorld에서는 Frame Preservation 방식을 기반으로 LoRA로 예비 학습 후 전체 파라미터 파인튜닝을 수행한다.
- Adaptive Layer-Norm (AdaLN)
- — 카메라 상대 포즈 Δπ를 Fourier 임베딩하고 MLP를 거쳐 Transformer의 layer-norm scale/shift를 조절하는 방식으로 카메라 제어 신호를 통합한다. 이 방식은 카메라 움직임을 토큰 수준이 아닌 표준화 파라미터로 주입하여 모델이 포즈 변화에 민감하게 반응하면서도 패치 임베딩 구조를 변경하지 않게 한다. AlayaWorld는 여섯 축(6 pose components)마다 임베딩을 적용해 per-axis 스케일을 데이터 통계에 맞춰 보정한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.