본문으로 건너뛰기

Echo-Forcing: 인터랙티브한 롱비디오 생성을 위한 Scene Memory 프레임워크

인터랙티브 롱비디오 생성은 프롬프트 변경과 장면 전환이 잦아 과거 정보의 무효화와 기억 충돌이 발생한다. Echo-Forcing은 historical KV states를 preserve-recall-forget의 라이프사이클로 관리하여 긴 시퀀스에서도 안정성과 프롬프트 대응성을 동시에 달성한다.

용어 해설

KV 캐시(KV cache)
KV cache는 프레임 간의 키-값 토큰을 보존하는 메모리로, 긴 비디오의 흐름에서 과거 정보를 현재 프레임에 맞춰 재활용하거나 필요에 따라 삭제하는 역할
RoPE(회전 위치 인코딩)(RoPE)
RoPE는 위치 정보를 각 어텐션 헤드의 쿼리-키 간 위상 차로 표현하고, 시간적 거리 증가에도 안정적으로 동작하도록 하는 인코딩 기법이다
Scene Recall Frames
Scene Recall Frames는 과거의 장면들을 공간적으로 구조화된 KV로 압축 저장하고 필요 시 다층 정보를 복원해 장기 기억을 촉진한다
드리프트 게이트(Drift Gate)
드리프트 게이트는 최근 쿼리 분포가 보정 기준과 어긋날 때 AMP의 기여를 조정해 오래된 기억의 영향력을 적절히 억제한다
계층적 시간 메모리(Hierarchical Temporal Memory)
계층적 시간 메모리는 KV 캐시를 early anchors, compressed history, recent windows로 구분해 장기 안정성, 글로벌 변화, 로컬 연속성을 각각 보장한다
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 15.수집 2026. 05. 21.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.