왜 중요한가
자율적 영상 세계 모델은 과거의 시점 컨텍스트를 유지하는 것이 중요한 반면, KV-cache의 전체 히스토리 접근은 계산과 메모리 비용을 기하급수적으로 증가시킨다. Sliding-window 접근은 속도는 보장하지만 재방문 시 일관된 내용을 잃게 한다. WorldKV는 이미 모델의 KV-cache를 활용해 Viewing-과 Action-기반의 재검색과 비중복 토큰 압축을 병행함으로써, 학습 없이도 재방문 시점의 일관성과 실시간 성능 사이의 균형을 달성한다.
핵심 기여
World Retrieval
evicted KV-cache 조각을 GPU/CPU 메모리에 저장하고, revisits 시 현재 시야와의 관련성(caméra/action correspondence)을 바탕으로 상위-k 조각을 선택해 활성 어텐션 윈도우에 재삽입한다. Retrieval은 camera/action 기반과 attention 기반 등 모듈식으로 구성 가능하다.
World Compression
Chunk 내의 중복 토큰을 제거하기 위해 anchor 프레임(각 chunk의 첫 프레임)과 다른 프레임의 키 간 코사인 유사도를 이용해 비중복 정보를 남긴다. 비유사도가 낮은 토큰만 남겨 각 chunk를 대략 2× 축소한다.
Retrieval-Algorithm Agnosticism
sim(·,·)를 camera/action 기반 지표나 query 기반 지표 등으로 구성해도 성능이 크게 저하되지 않으며, 다양한 신호에 대해 일반화 가능성을 보인다.
Training-Free Memory Management
WorldKV는 별도의 메모리 모듈 학습이나 백본 파인튜닝 없이도 KV-cache 기반의 장기 메모리를 활용해 긴 호라이즌에서의 재방문 품질을 유지한다.
핵심 아이디어 이해하기
단계별 직관
- 출발점과 한계: 자동회귀형 비디오 디퓨전 모델에서 KV-cache는 과거 프레임의 키-값 벡터를 저장하고 현재 프레임의 denoise에 사용한다. 전체 KV-cache를 모든 프레임에 걸쳐 읽으면 연산량과 VRAM 사용이 선형적으로 증가해 실시간 제어가 불가능해진다. Sliding-window 방식은 처리량을 보장하지만 원래의 장기 기억이Evicted되면서 revisit 시 일관성을 잃는다.
- 해결 원리: World Retrieval은 evicted KV-cache를 저장하고 revisit 시 현재 뷰와 시야가 겹치는 과거 KV-cache를 Top-k로 선택해 재삽입한다. 이때 sim(·,·)은 카메라 자세/액션 해석 또는 쿼리 가중치를 사용할 수 있어, 다양한 신호에 대해 재검색이 가능하다.
- 달라지는 점: World Compression은 인접 프레임 간의 중복 정보를 제거해 각 chunk의 저장 비용을 절반 수준으로 낮춘다. anchor 프레임과의 Key-Key 유사도 기반 pruning으로 새로운 정보는 보존하고, 중복 정보는 제거한다. 이 두 요소를 합치면 동일 메모리 예산에서 더 많은 과거 Chunk를 커버하게 되며, revisit fidelity를 유지한다.
방법론
전체 접근 방식
- WorldKV는 sliding-window inference 위에 두 가지 보완 컴포넌트를 얹는다: World Retrieval과 World Compression.
- World Retrieval: evicted KV-cache를 저장하고 revisit 시 현재 카메라/액션 상태에 따라 top-k 조각을 선택하여 R에 채운다. 실시간 제약을 유지하기 위해 top-k 선택은 sim(acur, ai) 합성 함수로 수행된다. R = Top-k (sim(acur, ai) | i = 1, ..., M).
- World Compression: 3-frame chunk에서 anchor를 첫 프레임으로 고정하고, non-anchor 프레임의 키 벡터를 anchor 프레임 키와의 average cosine similarity로冗長성(scores)을 계산한다. bottom P%를 남겨 chunck를 1.5T 토큰으로 축소한다. 이때 각 layer마다 독립적으로 수행되며, retrieval 시 각 layer는 retained tokens를 참조한다.
- 구현 세부: 18 latent 프레임의 슬라이딩 윈도우를 sink( 3 frame ), retrieval( 9 frame ), recent( 3 frame ), denoise( 3 frame)로 구분한다. Compression은 매 chunk 저장 시 anchor를 보존하고 non-anchor를 25% retention으로 압축한다. Retrieval은 camera pose가 직접 주어지는 LingBot-World-Fast와, discrete actions을 누적하여 구성하는 Matrix-Game-2.0에서 동일 전략으로 작동한다.
- 수식/알고리즘: World Retrieval의 재검색은 R = Top-k (sim(accur, ai) | i = 1, ..., M)이며, World Compression은 s(f)j = (1/T) sum_i k(f)j^T k(a)i / (||k(f)j|| ||k(a)i||)로 anchor 프레임의 키와 non-anchor 키 간 코사인 유사도를 계산하고, bottom P%를 retention한다. 실험 설정은 18 latent-frames window, anchor+retained tokens, 2× 압축으로 요약된다.
관련 Figure

WorldKV가 Full KV와 Sliding Window 사이에서 어떤 방식으로 재현되는지 시각적으로 확인 가능하다. 재현성 측면에서 WorldKV가 더 일관된 결과를 보여줄 수 있음을 시사한다.
WorldKV의 프레임-대-프레임 비교를 보여주는 다이어그램으로, Input Image와 각 방법의 결과 프레임 변화를 시각화한다.

KV 캐시의 소멸/저장-검색-재삽입 흐름을 시각화하여 World Retrieval의 동작 원리를 직관적으로 설명한다.
World Retrieval의 구조를 요약한 개요 다이어그램.

World Retrieval과 World Compression의 상호작용을 한 눈에 보여주며, sink/recent/retrieved/denoise 구간 구성을 설명한다.
Figure 4: WorldKV의 상호 작용 흐름 다이어그램
주요 결과
주요 벤치마크에서 WorldKV는 전체 KV-cache 어텐션과 메모리 trained baselines에 근접한 재방문 품질을 제공한다. LingBot-World-Fast에서 Full KV 대비 LPIPS 0.455 vs 0.441, PSNR 15.660 vs 15.901, SSIM 0.463 vs 0.472, FID 75.644 vs 85.705로 나타났고, Throughput은 WorldKV 4.78 FPS, Full KV 2.36 FPS로, 약 2×의 차이를 보인다. Matrix-Game-2.0에서는 Full KV 7.82 FPS, WorldKV 16.25 FPS로 2× 이상 향상된 처리량을 보이며, LPIPS 0.462 vs 0.529, PSNR 14.101 vs 13.748, SSIM 0.405 vs 0.364, FID 93.561 vs 124.912로 더 우수한 재방문 품질을 보인다.
- World Compression Ablation: intra-chunk에서 3→1.0(anchor-only) 보다는 3→1.5 또는 3→2.0이 성능을 더 안정적으로 보존한다. inter-chunk에서 6→3은 3→3 대비 더 넓은 히스토리 커버리지를 제공하며, 지나친 압축(9→3)은 성능을 저하시킨다. Matrix-Game-2.0에서는 WorldKV가 Full KV를 능가하는 경우가 있으며, LingBot-World-Fast에서도 FID를 개선하는 경향이 관찰된다.
관련 Figure

Full KV의 메모리 증가가 급격한 반면, WorldKV는 압축 및 부분 저장으로 메모리 증가를 억제한다. 실시간 인퍼런스의 VRAM 한계 문제를 직접적으로 뒷받침한다.
KV cache VRAM 사용량과 컨텍스트 길이에 따른 메모리 증가를 나타내는 그림.

Matrix-Game-2.0과 LingBot-World-Fast 모델에서 WorldKV가 Full KV보다 높은 Throughput을 유지하는 경향을 구체적으로 보여준다.
처리량(FPS) 대 컨텍스트 길이 그래프. Full KV 대비 WorldKV의 처리량이 안정적으로 유지됨을 시각화.

Matrix-Game-2.0과 LingBot-World-Fast에서 WorldKV가 Full KV 대비 프레임 품질 차이를 어떻게 보이는지 비교한다. 모델별 성능 차이가 명시된다.
Figure 5: 두 트래젝토리에서의 프레임-대-프레임 비교

선택적 검색이 전체 KV 어텐션보다 더 나은 일관성과 재방문 품질을 보임을 시각적으로 보여준다.
Appendix A: Selective Retrieval이 Full KV Cache Attention보다 우수하다는 시각 자료
기술 상세
아키텍처 구성: WorldKV는 sliding-window 기반 AR 비디오 디퓨전 모델 위에 World Retrieval과 World Compression의 두 모듈을 추가한다. 월드 Retrieval의 핵심은 evicted KV-cache를 저장하고, 현재 뷰 acur에 따른 top-k 후보를 선택하는 알고리즘이다. sim(·,·)은 camera+/action 기반 신호나 query 기반 신호로 구현될 수 있다. 선택된 KV-cache 조각은 현재 denoising Chunk 영역에 비재-Encoding 없이 직접 삽입된다. 월드 Compression의 핵심은 anchor 프레임을 기준으로 non-anchor 프레임의 키 벡터 간 코사인 유사도를 구하고, bottom P%를 유지하는 방식으로 중복 정보를 제거하는 것이다. 이로써 chunk 당 토큰 수가 대략 1.5T로 줄어들며, fixed budget에서 더 많은 과거 프레임을 확보할 수 있다. 학습/재현적 분석: WorldKV의 Retrieval은 camera/action 기반이 기본값이며, query 기반은 Appendix C에 대한 ablation에서 확인된다. 전체 시스템은 training-free로 구성되며, CPU offloading을 통해 VRAM 사용량을 줄일 수 있다(단, CPU-GPU 간 데이터 전송 대기시간이 실시간에 영향을 줄 수 있음).
관련 Figure

anchor 프레임 기반의 pruning으로 3-frame chunk가 1.5T 토큰으로 축소되는 과정을 시각적으로 확인한다. 메모리 절감의 핵심 메커니즘을 보강한다.
World Compression의 anchor 프레임과 비(anchor) 프레임의 Token 선택 과정을 보여주는 그림.
한계점
본 프레임워크는 frozen backbone 위에서 작동하는 메모리 관리 기법으로, 생성 품질은 기본 모델의 품질에 의존한다. 긴 롤아웃에서 누적 오류 가능성이 있으며, CPU 오프로드의 전송 латency가 실시간 성능에 영향을 줄 수 있다. 향후 파인튜닝과의 결합 없이도 더 긴 시퀀스에서의 안정성을 높이기 위한 학습 전략이 필요하다.
실무 활용
WorldKV는 학습 없이 KV-cache 기반의 장기 메모리를 효과적으로 관리하여, 실시간 인터랙티브 영상 세계 모델의 재방문 일관성과 프레임 품질을 유지하는 데 활용된다.
- 실시간 게임 엔진에서의 지속적 월드 시뮬레이션
- 로봇 시뮬레이션 및 embodied AI의 긴 호라이즌 비주얼 기억 유지
- 영화/미디어 제작에서의 지속적 가상 환경 렌더링
- 멀티-에이전트 시나리오에서 과거 뷰의 재현성 강화
코드 공개 여부: 비공개
키워드
용어 해설
- KV 캐시 어텐션(KV-cache Attention)
- — KV-cache의 과거 키-값 벡터를 재생성 과정에 활용하는 주된 기법으로, 시퀀스 간 일관성과 재방문 시점의 컨텍스트 유지에 기여한다.
- World Retrieval
- — evicted KV-cache를 GPU/CPU 메모리에 저장하고 재방문 시 시야에 맞는 KV 캐시를 선택적으로 불러와 활성 어텐션 윈도우에 삽입하는 메커니즘이다.
- World Compression
- — Anchor 프레임과의 키-키 유사도 기반으로 각 프레임의 토큰 중 중복되는 부분을 제거해 동일 치수의 정보를 절약하는 압축 기법이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.