TL;DR
이 논문은 학습 기반 비디오 생성 기법을 게임 엔진 수준의 상호작용으로 확장하려는 연구 방향을 체계적으로 정리했다. 게임 규칙에 따른 상태 전이와 장기적 결과 유지, 그리고 플레이어 입력에 대한 실시간 반응성이라는 상호보완적 요구를 네 가지 차원으로 명확히 규정했다. 또한 상태 기반 학습을 촉진할 대규모 프레임 정렬 데이터셋을 제공하여 상태-명시적 접근의 연구를 실험적으로 지원한다.
왜 중요한가
이 논문은 학습 기반 비디오 생성 기법을 게임 엔진 수준의 상호작용으로 확장하려는 연구 방향을 체계적으로 정리했다. 게임 규칙에 따른 상태 전이와 장기적 결과 유지, 그리고 플레이어 입력에 대한 실시간 반응성이라는 상호보완적 요구를 네 가지 차원으로 명확히 규정했다. 또한 상태 기반 학습을 촉진할 대규모 프레임 정렬 데이터셋을 제공하여 상태-명시적 접근의 연구를 실험적으로 지원한다.
핵심 기여
행동-상태-관찰 루프를 기반으로 한 통합적 분류틀 제공
상호작용형 월드 모델의 요구를 플레이어 액션 제어, 게임 상태 역학, 상태-관찰 지속성, 실시간 상호작용 생성의 네 차원으로 정리하고, 각 차원에서 기존 접근법을 대표 계열로 묶어 강점과 비용의 균형을 체계적으로 설명했다.
기술 계열별 장단점을 체계적으로 정리한 비교 분석
카메라 제어·모터 신호·의미 이벤트 기반 입력, 관찰 내 암묵 상태·학습 잠재 상태·명시적 상태라는 상태 표상 방식, 저장형 메모리와 추정형 메모리라는 지속성 전략, 샘플 축소·스트리밍·컨디셔닝 변화 중심의 실시간화 기법을 사례별로 구분하여 서로의 제약을 비교했다.
Black Myth: Wukong 기반 대규모 프레임 정렬 플레이 데이터 파이프라인과 90시간 데이터 공개
Unreal 엔진에서 엔진-내부 상태와 키보드·마우스 입력을 틱 단위 JSON으로 기록하고 ReShade/OBS 기반의 분할 녹화와 시스템 타임스탬프 정합으로 프레임 정렬을 보장한 파이프라인을 구축하여 1280×720, 30FPS, 90시간 분량의 RGB·Depth·프레임 정렬 액션·엔진 상태 데이터를 수집했다.
핵심 아이디어 이해하기
문제의 출발점은 플레이어 입력이 단순한 픽셀 변화가 아니라 규칙에 따라 누적되는 내부 상태를 변화시킨다는 점이다. 기존의 비디오 생성 접근법은 과거 관찰 창과 입력을 연결해 다음 프레임을 예측하는 데 집중했기 때문에 상태가 암묵적으로 픽셀 상관관계로 캡처되는 한계가 있었다. 이로 인해 규칙 기반 결과, 오프스크린에서 누적되는 변화, 그리고 상태에 따른 동일 입력의 다의성 같은 게임적 속성을 안정적으로 보장하기 어려웠다.
해결 원리는 상태를 추상적으로나마 명시적으로 다루는 축을 도입하는 것이다. 논문은 상태를 전혀 분리하지 않는 관찰 기반, 저차원 잠재 벡터로 유지하는 잠재 상태 기반, 그리고 기계가 읽을 수 있는 기호적·슬롯형 서술로 기록하는 명시적 상태 기반의 세 가지 표상 패밀리를 구분한다. 각 표상은 학습 가능성·해석 가능성·주석 데이터 요구량이라는 상충관계를 가진다는 점이 핵심이며, 명시적 상태는 규칙 준수와 장기적 일관성 확보에 유리하지만 대규모 상태 주석 데이터가 필요하다는 현실적 제약이 따른다.
이 접근은 실무적 의미에서 세 가지 변화를 가능하게 한다. 첫째, 상태를 입력으로 삼으면 동일한 키 입력이 상태에 따라 다른 결과를 내는 경우를 학습적으로 분리할 수 있다. 둘째, 상태 기반의 메모리 업데이트가 도입되면 오프스크린에서 발생한 변화가 재관찰 시에 반영될 근거를 제공한다. 셋째, 실시간 생성 파이프라인과 상태 추론을 결합하면 제어 지연과 결과 타이밍을 서로 다른 목적으로 최적화할 수 있어 게임성 요구를 더 정확히 충족할 수 있다.
관련 Figure

이 그림은 논문의 조직적 관점인 행동-상태-관찰 루프를 한눈에 보여주며 각 단계가 요구하는 기능적 책임을 명확히 구분했다. 플레이어 액션 제어, 게임 상태 역학, 상태-관찰 지속성, 실시간 생성의 네 축이 루프의 서로 다른 분기에서 어떤 역할을 하는지 시각적으로 연결하여 논문의 분류틀을 보강한다.
행동-상태-관찰 루프를 시각화한 다이어그램으로 플레이어 입력, 내부 상태 갱신, 상태 기반 렌더링, 관찰의 피드백 과정을 보여준다.
방법론
전체 접근 방식은 행동-상태-관찰 루프를 조직적 렌즈로 삼아 기존 연구들을 네 가지 차원으로 분류하고, 데이터 수집 파이프라인을 통해 명시적 상태 주석을 대규모로 확보하는 것에 중심을 두었다. 연구는 방법론적 기여와 데이터 공학 기여를 병행하여, 모델 분류와 함께 실제로 상태-정렬(supervised) 학습을 가능하게 하는 데이터 인프라를 설계했다. 이로써 상태를 조건으로 하는 학습·평가가 가능해진다는 엔드투엔드 목표가 설정되었다.
데이터 수집은 엔진 측면의 틱 단위 레코딩과 클라이언트 녹화의 시계 동기화로 구성되었다. 게임 엔진은 각 틱마다 JSON 형식으로 액션 ID, 월드 좌표, 애니메이션 상태, 속성(체력·스태미나 등)을 기록했고, 클라이언트 녹화는 ReShade 셰이더로 렌더 버퍼를 RGB와 Depth로 분할해 OBS로 캡처하면서 시스템 타임스탬프를 함께 기록했다. 두 기록은 동일한 시계 기준으로 정렬되어 프레임 단위 정합을 확보했으며, 캡처 설정의 표준화를 위한 도구가 병행 배포되어 크라우드소싱 기계 이질성으로 인한 변동을 최소화했다.
후처리 단계에서는 타임스탬프 정렬, 샘플 필터링(프레임 드랍·스터터링·오클루전 제거), 고정 길이 윈도우 단위의 슬롯 캡션 생성, 그리고 Qwen3-VL-235B-A22B-Instruct를 활용한 의미적 캡션 생성을 포함했다. 슬롯 캡션은 엔진 레코드의 수치적 정밀성을 보존하는 반면 의미 캡션은 자연어 기반의 상태 전이 기술 지표로서 사용 가능하도록 구성되었다. 이렇게 생성된 데이터는 상태 예측 학습과 상태 기반 조건부 생성 연구를 모두 수용할 수 있는 포맷으로 정제되었다.
관련 Figure

이 그림은 데이터 엔진의 엔드투엔드 흐름을 보여주어 수집·정합·후처리의 구체적 구현 요소를 드러낸다. ReShade/OBS 기반 분할 녹화, 시스템 타임스탬프 동기화, 오류 샘플 필터링, 그리고 슬롯 캡션과 의미 캡션 생성의 연결고리를 시각적으로 제시하여 데이터 신뢰성과 레이블링 절차의 구성도를 제공한다.
크라우드소싱 캡처와 데이터 처리 파이프라인을 나타낸 인포그래픽으로 캡처, 타임스탬프 정합, 샘플 필터링, 슬롯형 주석 과정을 요약하고 있다.
주요 결과
주요 산출물은 1280×720 해상도, 30FPS 조건에서 수집된 90시간 이상의 보스 전투 플레이 데이터이며, 각 프레임마다 엔진-내부 상태, 원시 키보드·마우스 입력, RGB와 Depth 프레임이 정렬된 형식으로 제공되었다. 데이터셋은 카메라·플레이어·보스의 포즈와 애니메이션 태그, 활성 스킬 및 게임 플레이 속성(HP, Stamina, ATK, DEF 등)을 포함하는 엔진-추출 상태 레코드를 함께 제공하므로 상태-정밀 감독 학습을 수행할 수 있다. 또한 로우 레코드를 슬롯형 텍스트 캡션과 Qwen3 기반의 의미 캡션으로 보강하여 텍스트 기반 상태 전이 학습과 생성 조건화에 모두 활용할 수 있게 구성되었다.
논문의 정리 분석 결과는 현존 방법들이 뷰포인트 제어와 탐사 가능한 장면 생성, 실시간에 근접한 샘플링 속도에서는 상당한 진전을 보였다는 점을 지적했다. 반면 규칙에 따른 결과의 타이밍 정렬, 오프스크린에서의 누적 상태 변화 반영, 그리고 상태에 따라 달라지는 입력 의미 해석 같은 과제는 대부분의 접근에서 여전히 해결되지 않았다고 기술되었다. 데이터 공개를 통해 명시적 상태를 조건으로 하는 모델의 연구와 평가가 촉진될 수 있다는 결론으로 연결되었다.
기술 상세
전체 구도는 행동-상태-관찰 루프를 중심으로 네 가지 연구 축을 정의하고, 각 축에 해당하는 기존 문헌을 대표 계열로 나누어 비교하는 이론적 정리와 데이터 파이프라인 구축이라는 두 축에서 기여를 병행했다. 논문은 입력 표현(기하학적 궤적, 모터 신호, 의미 이벤트), 상태 표상(관찰에 얽힌 암묵 상태, 학습 잠재 상태, 명시적 슬롯·텍스트 상태), 기억 메커니즘(저장형 관찰 기반, 동적 추정 기반), 실시간화 기법(단계 축소, 스트리밍, 컨디셔닝 변화)의 구조적 차이를 기술적으로 구분했다. 이러한 분류는 각 접근이 어떤 종류의 타이밍·일관성·데이터 요구를 수반하는지 명백히 드러낸다.
데이터 엔지니어링 측면에서는 엔진-내부 상태를 틱 단위로 JSON 직렬화하여 로컬 파일에 기록하고, 클라이언트 측에서는 ReShade 셰이더를 통해 렌더 버퍼에서 RGB와 Depth를 분할한 후 OBS의 시스템 타임스탬프와 함께 녹화하여 동일 시계 기준으로 정합했다. 이후 샘플링과 필터링 단계에서 드롭/스터터링 샘플을 제거하고 고정 길이 윈도우 단위로 슬롯 캡션을 집계했으며, 의미 캡션은 Qwen3-VL-235B-A22B-Instruct를 조건문맥으로 활용해 생성했다. 이 방식은 수치적 엔진 레코드의 정밀성과 자연어 주석의 가독성 두 축을 동시에 만족시키는 데이터 포맷을 만들었다.
모델 적용 관점에서는 명시적 상태를 조건으로 삼는 지도학습적 상태 전이(subsequent-state) 학습과 잠재 상태를 통한 롤아웃 확장 사이의 트레이드오프가 강조되었다. 명시적 상태는 규칙성 검증과 해석 가능성에서 이점이 있으나 대규모 주석 데이터가 필요하고, 잠재 상태는 주석 없이 확장 가능하지만 시각적 변화의 원인이 비시각적일 때 신뢰도가 낮아질 수 있다. 실시간 생성은 단계 축소(distillation), 스트리밍 재구성, 파이프라인 최적화를 병행해야 하고, 결과 타이밍은 생성 샘플링 속도뿐 아니라 상태-조건화의 시점 동기화 문제를 함께 고려해야 한다.
한계점
논문에서 밝힌 주요 한계는 명시적 상태-기반 접근이 대규모의 프레임 정렬 상태 주석을 요구한다는 점이다. 데이터셋은 보스 전투 장면에 집중되어 있어 게임 장르나 일반 장면으로의 직접적 일반화 가능성이 제한적이다. 또한 상태를 생성 루프에 통합하여 메모리 업데이트를 원칙적으로 보장하는 방법론적 해법은 여전히 개방된 문제로 남아 있다.
실무 활용
공개된 데이터셋과 파이프라인은 상태-명시적 학습을 요구하는 연구와 엔지니어링 실험에 바로 투입 가능한 자원을 제공한다. 슬롯 주석과 의미 캡션은 상태 전이 예측과 상태 조건부 생성 양쪽을 모두 지원하므로 다양한 모델 설계와 비교 실험에 적합하다. GitHub 저장소가 제공되어 데이터 파이프라인의 재현성과 확장이 가능하다.
- 상태-조건화 비디오 생성 모델 학습 및 비교 실험에 활용할 수 있다.
- 상태 추론 모델과 메모리 업데이트 정책의 장기 일관성 평가용 벤치마크로 사용할 수 있다.
- 실시간 스트리밍 생성 파이프라인에서 입력-결과 타이밍 정렬 기법을 검증하는 시스템 연구에 활용할 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Action-State-Observation Loop
- — 게임 엔진에서 플레이어 입력이 내부 상태를 갱신하고 그 상태로부터 장면을 렌더링하여 관찰을 생성하는 반복적 제어 고리로, 입력 표현·상태 표상·상태-관찰 일관성·실시간성 네 축의 요구사항을 규정한다.
- Slot-Structured Annotation
- — 엔진에서 추출한 프레임별 수치형 액션·상태 레코드를 사람이 읽을 수 있는 고정 필드(슬롯) 형태의 텍스트로 변환한 주석으로, 기계학습에서 다음 상태 예측 및 상태 기반 조건부 생성의 정답 신호로 활용된다.
- Frame-Aligned Data
- — 게임 엔진의 내부 상태·키보드·마우스 입력이 기록된 타임스탬프와 녹화된 RGB/Depth 프레임이 같은 시계 기준으로 프레임 단위로 정렬된 데이터로, 상태와 픽셀을 직접 연결해 상태-조건부 학습을 가능하게 한다.
- State-Observation Persistence
- — 관찰이 장기적으로 내부 상태와 일관되게 유지되는 특성으로, 오프스크린 시에도 규칙 기반의 결과가 누적되어 다시 나타날 때 시각적 결과가 이전 상태 변화를 반영해야 함을 의미한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.