본문으로 건너뛰기

FORCING-KV: 효율적인 Autoregressive 비디오 확산 모델을 위한 하이브리드 KV 캐시 압축

AR 비디오 확산 모델은 과거 프레임의 KV 캐시를 축적하는 동안 메모리 비용과 주의 계산량이 급증한다. 본 논문은 헤드별 기능 차이를 발견하고, static heads는 트랜지션 앵커 프레임에 집중하도록 고정적으로 보존하고, dynamic heads는 인접 프레임 간의 segment-wise 유사도에 기반한 동적 압축을 적용한다. 이를 통해 출력 품질은 유지하면서 KV 캐시 크기를 줄이고 추론 속도를 크게 향상시킨다.

용어 해설

KV 캐시(KV Cache)
KV cache는 Transformer류 아키텍처에서 Key-Value 쌍을 재사용해 시퀀스의 과거 컨텍스트를 효과적으로 활용하는 기법이다. AR 비디오 확산에서 과거 프레임들의 KV를 저장해 주기적으로 조회하는 구조를 가지며, 이 논문은 KV 캐시의 메모리 사용과 연산 비용을 줄이기 위한 하이브리드 압축 전략을 제시한다.
Static Head
Static Head는 AR 비디오 확산에서 현재 생성 프레임 및 최근 프레임으로의 지역적(로컬) 자기-주의를 유지하는 헤드로, 트랜지션 앵커 프레임에 집중하여 프레임 간 품질과 연속성을 보존하는 역할이다.
Dynamic Head
Dynamic Head는 서로 다른 프레임 간에 같은 공간 위치의 시간적 변화를 포착하는 헤드로, 프레임 간 동적 일관성과 모션 정보를 확보하는 역할을 한다.
Transition Anchor Frame
Transition Anchor Frame은 AR 비디오 생성에서 현재 챙겨진 프레임의 위치를 기준으로, 과거 프레임 중에서도 특히 중요한 프레임으로 간주되는 프레임이다. Static Head가 주로 이 프레임에 주의를 집중해 프레임 간 전환을 안정적으로 만든다.
Segment-wise Similarity
Dynamic Head의 압축에서 인접 프레임 간 구간(segment) 단위로 코사인 유사도를 계산해 유사도가 높은 구간을 제거하거나 보존하는 방법으로, 시간적 변화가 적은 영역은 제거하고 변화가 큰 영역은 유지한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 10.수집 2026. 05. 16.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.