TL;DR
인터랙티브 월드 모델은 단일 프레임 품질을 넘어서 사용자 행동에 연속적으로 반응하며 장기 일관성을 유지해야 하는데, 본 논문은 이런 요구를 데이터 수집부터 학습·배포까지 통합적으로 최적화한 전체 스택으로 제시했다. 특히 게임·시뮬레이션·인터넷 영상의 상보적 데이터 파이프라인과 training-feedback 기반의 WorldExplorer 수집 루프는 행동 지도 신호와 시계열 다양성을 동시에 확보한 점에서 차별화된다. 또한 LongForcing를 포함한 단계적 bidirectional→causal 증류 전략과 경량화된 디코더·저비트 추론 설계로 단일 데스크탑 GPU에서 실사용 가능한 실시간 상호작용을 달성한 점이 실무적 의미를 가진다.
왜 중요한가
인터랙티브 월드 모델은 단일 프레임 품질을 넘어서 사용자 행동에 연속적으로 반응하며 장기 일관성을 유지해야 하는데, 본 논문은 이런 요구를 데이터 수집부터 학습·배포까지 통합적으로 최적화한 전체 스택으로 제시했다. 특히 게임·시뮬레이션·인터넷 영상의 상보적 데이터 파이프라인과 training-feedback 기반의 WorldExplorer 수집 루프는 행동 지도 신호와 시계열 다양성을 동시에 확보한 점에서 차별화된다. 또한 LongForcing를 포함한 단계적 bidirectional→causal 증류 전략과 경량화된 디코더·저비트 추론 설계로 단일 데스크탑 GPU에서 실사용 가능한 실시간 상호작용을 달성한 점이 실무적 의미를 가진다.
관련 Figure

이 그림은 논문의 목표인 실시간 행동-조건형 월드 롤아웃과 시각적 다양성을 직관적으로 전달한다. 여러 장면 샘플은 게임·자연·도시 환경에서 동일한 키보드 제어가 일관된 동작 변화를 유발함을 시사하며, 로고와 함께 720P·16 FPS·19 GiB 같은 배포 지표를 시각적으로 병기해 성능 목표와 결과를 연결한다.
ABot-World-0의 시스템 전경을 요약하는 그림으로서 다양한 장면에서의 행동-조건형 롤아웃 예시와 모델 명칭, 성능 핵심 지표를 함께 제시하고 있다.
핵심 기여
단일 모델로 장기 상호작용을 지원하는 행동 조건형 비디오 월드 모델
ABot-World-0은 원시 키보드 입력을 통일된 제어 인터페이스로 사용해 장면 로밍과 제3인칭 캐릭터 제어를 모두 지원하며, 참조 캐릭터 메모리를 통해 제3인칭 롤아웃에서 외형 일관성을 유지했다. 이 구조는 소스별(게임·시뮬·인터넷) 제어 신호를 공통 표현으로 정규화해 추론 시 실제 사용자 입력과 자연스럽게 연결되도록 설계되었다. 모델 아키텍처는 VAE 기반 압축과 DiT 기반 생성 백본에 액션 어댑터 및 메모리 토큰을 덧붙이는 방식으로 구현되었다.
훈련-피드백 기반 WorldExplorer 수집 루프와 14단계 품질 필터링
데이터 인프라는 AAA 게임, UE+3DGS 시뮬레이션, 인터넷 비디오를 결합해 행동 레이블과 동기화된 멀티모달 트랙을 확보하고, WorldExplorer가 모델 성능 진단에 따라 수집 비중을 동적으로 재조정하도록 구성되었다. 수집된 샘플은 파일 무결성부터 지오메트릭·시맨틱 검증, VLM 기반 스크리닝까지 14개의 결정적 검사 단계를 거쳐 학습용으로 선별되었다. 이러한 폐쇄 루프는 모델 약점 영역에 데이터를 집중 투입하는 방식으로 데이터 효율성을 향상시켰다.
bidirectional teacher에서 causal student로의 점진적 증류와 LongForcing
먼저 전체 시퀀스 정보를 활용하는 bidirectional teacher를 학습한 뒤, teacher forcing으로 인과적 학생으로 적응시키고 ODE distillation으로 다단계 denoising을 소수 단계로 압축했다. 최종적으로 LongForcing 단계에서 학생의 자기 롤아웃 분포를 장시계열 교사 분포와 정렬해 누적 오류로 인한 장기 드리프트를 완화했다. 이 세 단계는 고품질의 전역적 시간 정보를 보존하면서 실시간 배포에 적합한 인과 모델을 얻도록 설계되었다.
단일 RTX 5090에서 동작하는 전용 배포 스택과 전범위 저비트 운영
추론 스택은 LightVAE로 디코딩 비용을 낮추고 SageAttention2·Fast-RoPE·KV 캐시 양자화 등으로 attention·포지셔널 오버헤드를 줄였다. DiT의 연산 집약적 선형층은 FP8 등 저비트 혼합정밀도로 양자화하여 처리량을 개선했으며, 모듈별 메모리 스케줄링으로 피크 VRAM을 19 GiB 내로 억제했다. 최적화된 설정에서 1280×704 해상도로 청크당 3 latent 프레임을 생성·디코딩해 12 decoded 프레임을 얻는 조건에서 최대 16 FPS, 액션-투-퍼스트프레임 1.2초를 보고했다.
핵심 아이디어 이해하기
문제 출발점은 행동-조건형 장기 비디오 롤아웃에서 발생하는 누적 오류와 인과성 제약의 충돌이다. Bidirectional 모델은 전체 시퀀스 정보를 사용하므로 시계열 전역 일관성과 고품질 모션을 학습하기에 유리하지만 실시간 온라인 롤아웃에 필요한 인과적 샘플링을 직접 지원하지 못한다. 반대로 단순한 autoregressive 모델은 인과성은 가지지만 노이즈·오류가 누적되면 장기 일관성이 급격히 저하되는 경향이 있다.
방법론
전체 방법은 데이터 파이프라인, 교사-학생 증류, 장기 롤아웃 정렬, 그리고 배포 스택으로 구성된 전 범위 설계이다. 데이터 파이프라인은 WorldExplorer를 통해 게임·시뮬·인터넷 영상을 동기화된 멀티모달 트랙으로 수집하고 14단계의 결정적 품질 검사와 VLM 기반 의미 검증을 적용해 학습용 클립을 확보한다. 학습 단계는 대규모 다원소스 행동-비디오 코퍼스로 먼저 bidirectional teacher를 학습한 뒤 teacher forcing, ODE distillation, LongForcing의 순으로 학생 모델을 점진적으로 변환하여 인과성·저지연·장기 안정성을 동시에 확보한다.
관련 Figure

이 다이어그램은 학습 데이터가 어떻게 다원적 소스에서 통합되어 모델 학습에 투입되는지를 구조적으로 보여준다. 특히 WorldExplorer의 훈련-피드백 루프와 14개 검사 항목을 통해 데이터 분포를 능동적으로 재조정하는 설계가 데이터-모델 폐쇄 루프를 형성함을 시각적으로 확인할 수 있다.
데이터 파이프라인 개요 다이어그램으로서 수집원, WorldExplorer 기반 에이전트 수집, 합성 파이프라인, 인터넷 파이프라인, 그리고 다단계 품질 필터링과 구조화된 주석 흐름을 보인다.

그림은 Teacher Forcing, ODE Distillation, LongForcing의 세 단계를 단계별로 배치해 각 단계의 목표와 역할을 분명히 한다. 특히 ODE Distillation이 다단계 denoising을 소수 단계 흐름으로 근사하고 LongForcing이 장기 자기 롤아웃 분포 정렬을 담당함을 한 눈에 파악하게 해 준다.
bidirectional teacher에서 autoregressive causal student로의 점진적 전환 과정을 개념적으로 정리한 모델 학습 파이프라인 도표이다.
주요 결과
정량 평가는 WorldRoamBench에서 수행되었으며 ABot-World-0는 Action, Visual, Physics, Memory 하위 지표 전반에서 경쟁력 있는 결과를 기록했다. 시스템 수준 성능으로는 단일 NVIDIA RTX 5090 기준에서 해상도 1280×704, 청크 설계에 따라 최대 16 FPS와 액션-투-프레임 1.2초를 달성했고 피크 VRAM은 약 19 GiB 이내였다. LongForcing의 효과를 60초 롤아웃에서 비교한 결과 장후반부에서 HPSv3 점수 유지와 블러·패치 반복·과포화율 지표 개선으로 시각적 오류 누적이 줄어드는 것이 관측되었다.
관련 Figure

이 이미지들은 장시간 롤아웃 동안 장면 구조와 액션 반응이 유지되는 양상을 시각적으로 제시한다. 롤아웃 초중후반의 키프레임 비교를 통해 LongForcing와 전체 파이프라인이 누적 오류를 억제하고 시각적 식별성·운동 연속성을 유지함을 관찰할 수 있다.
시계열 키프레임 스트립으로 구성된 장시간(시간·일 단위) 롤아웃 예시들이며 각 샘플은 타임스탬프와 간단한 캡션을 포함한다.

여러 환경에서의 연속 프레임은 모델이 장환경 변화와 상호작용에도 불구하고 일관된 캐릭터 정체성과 연속적 모션을 유지함을 시사한다. 이미지들은 또한 실제 제어 입력이 장면 변화에 어떻게 대응하는지를 사례별로 보여줘 제어-효과 정합성을 보강한다.
추가적인 장기 롤아웃 예시들이며 다양한 기후·지형 조건에서의 행동 추적을 연속 프레임으로 배열해 보여준다.

극한 환경 키프레임은 노이즈·저대비·동적 조명 조건에서도 롤아웃이 급격히 붕괴하지 않고 구조적 연속성을 보이는 것을 보여준다. 이는 모델이 단지 텍스처를 반복하는 수준을 넘는 시퀀스 수준의 동적 처리를 학습했음을 시사한다.
야간·스노우·산악 등 극한 환경에서의 하루 단위 롤아웃 키프레임 배열로서 누적 오류가 심할 수 있는 조건에서의 안정성을 보여준다.

이 패널은 게임·시뮬·인터넷 데이터가 결합된 다원적 학습 데이터의 결과물로서, 동일한 키 입력에 대해 장면과 캐릭터가 상황에 맞게 다르게 반응한다는 점을 보여준다. 또한 제3인칭 인물 외형 보존과 장면 맥락 유지가 동시 달성되는 사례들을 포함해 실용적 제어 가능성을 강조한다.
다양한 도시·인물·풍경 장면에서의 상호작용 롤아웃 샘플이 모인 패널로서 소스 다양성과 제어 일관성을 시각적으로 보여준다.
기술 상세
전체 아키텍처는 VAE 기반의 시공간 잠복(latent) 압축과 DiT(Diffusion Transformer) 기반의 생성 백본을 중심으로 구성되어 있다. 액션 입력은 프레임 레벨의 8차원 다중-핫 키보드 벡터(W/A/S/D, I/J/K/L)를 4프레임 단위로 채널 방향으로 병합해 32차원의 시간-정렬 액션 토큰으로 만든 뒤 PixelUnshuffle+Conv Residual 블록을 사용하는 Action Control Adapter를 통해 patch embedding에 덧붙이는 토큰-단위 가산 주입 방식을 취했다. 제3인칭 외형 일관성 확보를 위해 참조 이미지들을 VAE로 인코딩한 identity-memory 토큰을 시간 RoPE 인덱스에서 음수로 고정하고 비대칭 attention으로 메모리→비디오 조회만 허용해 롤아웃 전반에 걸쳐 외형 정보를 지속적으로 참조하게 했다.
한계점
논문은 여전히 장기 드리프트를 완전히 제거할 수 없음을 인정하고 있으며 LongForcing가 드리프트를 완화하지만 완전한 해법은 아니라고 명시했다. 또한 현재 설계는 원시 키보드 입력을 전제로 하므로 연속 카메라 궤적이나 더 구조화된 의미적 명령에는 추가적인 조건화 설계가 필요하다고 언급되었다. 저비트 운영에서의 품질-속도 절충과 양자화 민감성 관련 추가 연구가 필요하다는 점도 논문에서 명시적으로 지적되었다.
실무 활용
ABot-World-0은 로컬 데스크탑 환경에서 실시간 인터랙티브 비주얼 시뮬레이션을 구동할 수 있도록 설계되어 있어 게임 프로토타이핑, 인터랙티브 콘텐츠 제작, 그리고 embodied agent 학습용 시뮬레이터로 활용 가능성이 높다. 학습 데이터와 배포 설정을 병행 최적화한 점이 현장 적용성을 높이며, 참조 캐릭터 메모리와 통일된 키보드 액션 인터페이스는 사용자 입력을 직접 연결하는 응용에 적합하다. 다만 실무 적용을 위해서는 도메인별 세부 튜닝과 저비트 설정에서의 품질-속도 절충 확인이 필요하다.
- 게임 제작 과정에서 실시간 시나리오 검증과 비주얼 프로토타이핑을 위한 대화형 월드 시뮬레이터
- 로컬 환경에서 동작하는 에이전트 학습용 시뮬레이터로서 장기 일관성 평가 및 행동 정책 디버깅
- 인터랙티브한 콘텐츠 생성 도구로서 사용자가 키 입력만으로 긴 시퀀스를 탐색·기록·편집하는 워크플로
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- ODE Distillation
- — 확률 흐름 확률미분방정식(ODE)을 이용해 다단계 노이즈 제거 과정을 소수 단계 예측기로 압축하는 기법으로, 중간 노이즈 상태에서 본래 모델의 ODE 통합 결과(클린 엔드포인트)를 목표로 학습하여 추론 단계의 반복적 denoising 횟수를 줄이는 방식이다.
- LongForcing
- — 학생 모델의 자기 롤아웃 분포를 장시간 시퀀스로 생성해 이를 장시간 범위의 교사 모델 분포와 정렬시키는 분포-수준의 증류 단계로, 누적된 오차로 인한 장기 드리프트를 완화하기 위해 확장된 시계열 교사의 감독 신호를 제공한다.
- Reference-Character Memory
- — 제3인칭 롤아웃에서 등장인물의 외형 일관성을 유지하기 위해 인물의 정면·후면·좌우 등 표준화된 참조 이미지를 VAE로 인코딩해 별도 메모리 토큰으로 삽입하고, 비대칭 attention 패턴으로 롤아웃 전반에 걸쳐 외형 정보를 지속적으로 참조하는 기법이다.
- KV Cache
- — 자율 롤아웃 중 이전 토큰의 key·value를 로컬 캐시에 보관해 attention 계산에서 재사용함으로써 전체 히스토리를 다시 계산하지 않고 장기 문맥을 일정 범위 내에서 유지하는 메모리 구조이며, 롤아웃 길이가 늘어날 때의 메모리 성장 문제를 완화하는 핵심 요소다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.