본문으로 건너뛰기
HF Daily Papers조회 3

시야에서 사라져도 잊지 않는 마음: 동적 비디오 월드 모델을 위한 하이브리드 메모리

기존 비디오 생성 모델은 물체가 화면 밖으로 나갔다가 다시 들어올 때 그 정체성을 잊어버리거나 형태를 왜곡하는 고질적인 문제가 있었다. 이 연구는 정적 배경과 동적 물체를 동시에 관리하는 하이브리드 메모리 기술을 통해 복잡한 물리적 상호작용이 포함된 비디오 생성의 일관성을 획기적으로 높였다.

용어 해설

비디오 월드 모델(Video World Model)
물리적 세계의 역학을 시뮬레이션하여 비디오를 생성하는 AI 모델이다. 자율 주행이나 로봇 공학에서 미래 상황을 예측하고 학습 데이터를 생성하는 데 필수적인 기술이다.
시공간 일관성(Spatiotemporal Consistency)
비디오의 시간적 흐름과 공간적 구조가 프레임 간에 어색함 없이 유지되는 성질이다. 물체가 움직이거나 카메라 시점이 변해도 형태와 위치가 논리적으로 연결되어야 함을 의미한다.
디퓨전 트랜스포머(Diffusion Transformer)
Transformer 아키텍처를 Diffusion 모델의 백본으로 사용하는 구조이다. 대규모 데이터 학습에 유리하며 고화질 비디오 생성에서 뛰어난 성능을 발휘한다.
메모리 토큰화(Memory Tokenization)
방대한 과거 정보를 효율적으로 참조하기 위해 핵심적인 특징만을 추출하여 압축된 토큰 형태로 변환하는 과정이다. 연산량을 줄이면서도 중요한 맥락 정보를 보존하는 역할을 한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 27.수집 2026. 03. 31.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.