본문으로 건너뛰기

MemLearner: 쿼리 토큰 기반의 학습형 컨텍스트 질의로 장기 일관성을 확보한 Video World Models

Video World Models는 상호작용 환경에서 과거 장면을 기억하지 못해 장기 생성에서 장면 불일치가 발생하는 문제가 핵심적이다. 본 논문은 규칙 기반의 컨텍스트 검색이 차폐나 동적 객체 상황에서 실패하는 점을 지적하고, pretrained 생성 모델의 시각적 priors를 활용하여 학습 가능한 쿼리 메커니즘으로 이를 보완했다. 이 방식은 추가적인 3D 재구성이나 별도 모듈 없이 컨텍스트 활용 능력을 향상시켜 실세계 도메인으로의 일반화 가능성을 확보했다.

용어 해설

쿼리 토큰(Query Tokens)
컨텍스트 토큰과 예측 토큰 사이에서 주의를 수행하여 과거 프레임으로부터 유용한 정보를 선택적으로 추출하는 학습 가능한 토큰 집합으로, diffusion 과정의 각 단계와 예측 프레임마다 서로 다른 주의 분포를 학습하여 장기 기억을 지원한다.
Diffusion Transformer(Diffusion Transformer (DiT))
latent 영상 확산 모델에서 시공간적 주의를 포함하는 Transformer 기반 생성기 구조로, 2D attention, 3D attention, cross-attention, FFN 블록을 순차적으로 적용해 노이즈 예측을 수행하여 고품질 비디오를 생성하는 핵심 아키텍처이다.
컨텍스트 검색(Context Retrieval)
과거 프레임들 가운데 현재 생성에 유효한 프레임을 선택하여 조건으로 제공하는 기법으로, 규칙 기반 FOV 중첩이나 포인트클라우드 매칭이 기존 방식이며 본문에서는 이를 학습 가능한 쿼리로 대체하여 일반화 성능을 개선한다.
카메라 인코더(Camera Encoder)
프레임별 카메라 포즈(R, t)를 소형 MLP로 임베딩하여 Diffusion Transformer 내부 특징에 주입하는 모듈로, 서로 다른 데이터셋의 포즈 품질을 분리 처리하기 위해 데이터 타입별 전용 인코더를 사용한다.
재방문 비교(Revisit Comparison)
카메라가 장면을 되돌아올 때 생성된 전·후 경로의 대응 프레임 쌍을 비교하여 장면 일관성과 기억 능력을 계량화하는 평가 방식으로, outbound와 return 경로의 PSNR과 LPIPS 평균으로 메모리 성능을 측정한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 30.수집 2026. 07. 02.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.