왜 중요한가
FPS 게임은 프레임마다 고주파의 복합 제어 신호를 필요로 한다. 기존 월드 모델은 글로벌 conditioning으로 모든 픽셀에 동일한 액션이 주입되어 in-scope 지역에서의 디테일이 손상되거나 불안정해진다. SCOPE은 각 트랜스포머 블록에 per-pixel conditioning 모듈을 삽입하고, Discrete 이벤트를 in-scope로 국소화하는 cross-attention과 Continuous 제어를 out-of-scope의 안정적 생성을 위한 시퀀스 모델링으로 분리한다. CrossFPS 데이터셋으로 다중 게임에서 zero-shot 일반화를 달성한다.
핵심 기여
SCOPE 모듈을 DiT 블록에 삽입한 per-pixel conditioning
transformer 블록마다 SCOPE 모듈을 추가하고, x를 픽셀 단위의 시퀀스로 재구성하여 각 위치가 로컬 시각 콘텐츠에 따라 액션 응답을 계산하게 한다. Discrete 이벤트는 visually-queried cross-attention으로 in-scope에 국한되며, Continuous 제어는 temporal self-attention으로 out-of-scope 생성을 보정한다.
CrossFPS 데이터셋 구축
7개 FPS 타이틀에서 69K clips, 10-DoF 텔레메트리로 구성되며, Action Distribution Balancing, Visual-Action De-biasing, Kinetic Normalization 등으로 게임 간 편향을 제거하고 다게임 일반화를 촉진한다.
End-to-end 학습과 Action-CFG
SCOPE 모듈과 백본을 500에폭 규모로 함께 학습하고, Training 시 Action dropout과 Inference 시 Action-CFG로 액션의 강도를 제어한다. v_hat = v_uncond + λ(v_cond − v_uncond) 형태의 conditioning 강화 메커니즘을 사용한다.
Cross-game 일반화와 실험적 증거
unseen scenes에서의 일반화와 다중 금지 상황에서의 동작 민감도 및 품질 유지에 관한 정량적 증거를 제시한다. 7개 지표 중 7개에서 최상 혹은 동등 수준의 성능을 달성한다.
핵심 아이디어 이해하기
- 기존 세계 모델은 FPS의 고주파 다중 제어를 처리하기에 부족하다. 전역 conditioning은 화면의 모든 픽셀에 동일한 액션 신호를 주어 국소 이벤트가 확산되거나 흐트러진다. 2) SCOPE는 각 픽셀의 로컬 시각 콘텐츠로부터 독립적으로 액션 정보를 누적하는 per-pixel temporal 시퀀스를 만든다. 3) Discrete 이벤트는 visual query를 이용한 cross-attention으로 in-scope에만 반응하게 하고, Continuous 제어는 temporally 연속된 self-attention으로 out-of-scope의 장면 흐름을 안정적으로 모델링한다. 4) CrossFPS 데이터로 다게임에서의 시각-동작 매핑을 학습하면 unseen scenes에서도 zero-shot transfer가 가능해진다.
방법론
- 전체 접근: 프리트레인 DiT 백본에 30개의 SCOPE 모듈을 각 Transformer 블록에 삽입하고, 출력은 0으로 초기화된 상태에서 시작해 엔드-투-엔드로 학습한다. - 액션 표현: ac는 4차원 연속 제어(이동 및 카메라), ad는 6차원 이산 버튼으로 구성되며, per-pixel 타임라인 x_hat으로 재구성한다. - 이중 경로 처리: Discrete 이벤트 ∆xd는 CrossAttn(Q=x_hat, K=V=MLPembed(ad))를 통해 in-scope 영역에만 작용하고, Continuous ∆xc는 MLPfusion([x_hat; flatten(w)]) 후 Temporal Self-Attn으로 out-of-scope를 보정한다. - 학습: L = E_{t,z0,ε} [ w(t) || vθ(zt,t,c) − (ε − z0) ||^2 ], c에는 액션 정보가 포함된다. - 추론: Action-CFG를 사용해 v_hat을 얻고 ODEStep으로 다음 프레임을 생성한다. - 데이터: CrossFPS는 65K 이상의 학습 샘플과 7개 타이틀, 20fps, 480×832 해상도를 사용하며, Spatial/Temporal 정규화 및 균형 샘플링을 적용한다.
관련 Figure

아키텍처 구성요소를 시각적으로 요약하며, in-scope/out-of-scope 구분의 시각적 예시를 제공한다.
SCOPE의 아키텍처 및 인용된 예시 프레임을 보여주는 그림

CrossFPS 데이터 구조와 10-DoF 입력 흐름, SCOPE의 작동 맥락을 시각화한다.
CrossFPS 및 per-pixel conditioning 개요를 담은 인포그래픽

FP 제어 입력의 구성과 10-DoF 입력 체계를 시각적으로 제시한다.
Action Inputs와 게임 컨트롤 GUI를 요약한 인포그래픽
주요 결과
주요 벤치마크 및 실험 결과를 요약한다. Table 1의 CrossFPS 테스트에서 SCOPE는 7개 지표에서 최고 성능을 달성하고, Motion Smoothness에서 Matrix-Game 3.0이 더 우수한 경우를 제외한다. JEPA 0.806, FVD 690.3, LPIPS 0.601, Dyn.Deg 0.910, Flow 18.24, Smooth 0.198, Depth 1.299를 기록한다. Baselines는 Matrix-Game 3.0(JEPA 0.366, FVD 1022.7, LPIPS 0.692, Dyn 0.661, Flow 13.36, Smooth 2.502, Depth 1.524), LingBot-World(Act)(JEPA 0.615, FVD 954.4, LPIPS 0.627, Dyn 0.868, Flow 15.50, Smooth 2.215, Depth 1.454), HY-World 1.5(JEPA 0.464, FVD 1131.7, LPIPS 0.611, Dyn 0.225, Flow 2.37, Smooth 1.690, Depth 1.502). Ablations(4.2)와 Unseen Scene 일반화(4.4)에서의 성능 차이도 제공된다.
관련 Figure

SCOPE의 qualitative 차이가 baselines 대비 out-of-scope 안정성과 in-scope 반응성을 어떻게 달성하는지 시각적으로 보여준다.
Qualitative 비교(실험 예시) 그림
기술 상세
- 백본: Wan2.2-TI2V-5B, L=30, hidden=3072, heads=24, patch size [1,2,2], FFN=14336. 텍스트 인코더: UMT5-XXL, VAE: 8× 공간 압축, 4× 시간 압축. 2) SCOPE 모듈: fusion MLP(연속 제어 처리), cross-attention(Discreet 사건 처리), temporal RoPE 임베딩. 3) 학습: AdamW, lr=1e-5, bf16, gradient checkpointing, 500 에폭, 8GPU, DDP. 4) 손실/목표: flow matching(L(zt,t,c) 위주)로 vθ를 예측하고, first-frame latent를 conditioning에 포함, zt = (1−t) z0 + t ε. 5) Inference: v_hat = v_uncond + λ(v_cond − v_uncond); ODEStep를 통해 z_{t+1}를 얻는다. 6) 데이터: CrossFPS 69K clips, 7 Titles, 20fps, 480×832, 5초 클립.
관련 Figure

데이터셋의 다게임 구성과 클립 수의 분포를 정량적으로 보여주며 CrossFPS의 규모를 시사한다.
CrossFPS 69K 클립의 분포를 나타내는 도넛 차트
한계점
다중 단계 복합 동작(예: 다중 발사/무기 조작)이나 아이템 사용과 같은 더 긴 시퀀스 제어에 대한 일반화는 한계로 남아 있다. 데이터 다양성 확대 및 장시간 상태 일관성 연구가 필요하다.
실무 활용
CrossFPS로 학습된 SCOPE 구조는 FPS 스타일의 고주파 제어를 필요로 하는 인터랙티브 비디오 생성에 일반화 가능성을 보여준다. 이는 게임 엔진 대체나 시뮬레이션 기반 연구에 활용될 수 있다.
- 다중 게임 환경에서의 프롬프트 없는 인터랙티브 월드 모델 시뮬레이션
- 로봇형 시뮬레이션에서의 고주파 사용자 입력 반응 시각화
- 게임 개발에서의 빠른 컨트롤러 시나리오 테스트
- 제로샷으로 새로운 게임 환경에 대한 시각-액션 매핑 평가
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 픽셀별 시간 시퀀스(Per-pixel Temporal Sequences)
- — 각 공간 위치가 로컬 시각적 콘텐츠에 따라 독립적으로 시간 축의 시퀀스를 형성해, 고정된 전역 조건 대신 픽셀 단위로 액션 정보를 누적하도록 하는 표현 방식이다. SCOPE에서 디스크리트 이벤트의 국소적 효과를 보존하고 out-of-scope 영역의 연속 생성과의 간섭을 최소화하는 핵심 기법이다.
- Scope 분리(Scope Separation)
- — In-scope와 out-of-scope 영역을 픽셀 단위에서 구분하는 원칙으로, 디스크리트 이벤트를 국소 영역에 한정하고 카메라/ego-motion으로 인한 연속 생성을 안정화한다.
- Action-CFG
- — Action Classifier-Free Guidance로, inference 시 conditional velocity v_cond와 unconditional velocity v_uncond를 섞어 액션의 강도를 조절하는 가이드 기법이다. λ 파라미터로 조건화 강도를 조절한다.
- 시각 쿼리 교차 어텐션(Visual Queries Cross-Attention)
- — queries가 로컬 시각적 콘텐츠를 기반으로 동작하도록, discrete action을 per-pixel로 매핑하는 cross-attention 프로세스이다.
- Video Diffusion Transformer
- — 비디오 디퓨전 모델의 트랜스포머 기반 백본으로, 3D RoPE를 포함한 self-attention과 cross-attention을 통해 시계열 영상 생성을 수행한다.
- CrossFPS 데이터셋(CrossFPS dataset)
- — 7개 FPS 타이틀에서 69K clips를 프레임 정렬된 10-DoF 액션 텔레메트리와 함께 수집한 다게임 다중 도메인 데이터셋이다. 편향 제거 및 균형 샘플링이 수행된다.
- 키네틱 정규화(Kinetic Normalization)
- — 다양한 엔진 간 카메라 회전 속도 차이를 Optical Flow 기반 gain calibration으로 보정하는 기법이다. Gradients를 정렬시키고 다게임 학습의 안정성을 돕는다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
