본문으로 건너뛰기

Random Attention으로 KV 캐시 점수화를 제거한 추론 압축

프롬프트를 고정하고 나머지 KV 캐시를 Head별 무작위로 보존해 기존 Evictor와 비슷한 정확도와 32–43% 높은 vLLM 처리량을 달성했습니다.

용어 해설

KV 캐시(KV Cache)
Transformer가 이전 토큰의 Key와 Value를 저장해 다음 토큰 생성 때 재사용하는 메모리 구조입니다. 생성 토큰이 늘면 저장 항목도 선형으로 증가하므로 긴 추론에서는 GPU 메모리 병목이 됩니다. KV 캐시 Eviction은 예산을 넘은 항목을 영구 삭제해 메모리를 제한합니다.
KV 캐시 Eviction(KV Cache Eviction)
고정된 메모리 예산 안에 KV 캐시를 유지하려고 일부 토큰의 Key-Value 쌍을 삭제하는 기법입니다. 각 토큰의 향후 중요도를 점수화한 뒤 상위 항목을 보존하는 방식이 일반적이지만, 삭제된 항목은 이후 복구할 수 없습니다.
Attention Head
Multi-Head Attention을 구성하는 독립적인 부분 모듈입니다. 각 Head는 토큰의 Key-Value 복사본을 별도로 저장하고 현재 Query와의 관련도를 계산합니다. 이 논문에서는 Head별 독립 보존이 추론 흔적의 중복성을 높이는 핵심 구조로 작동합니다.
추론 흔적(Reasoning Trace)
모델이 문제를 풀면서 생성하는 중간 추론 토큰의 연속입니다. 논문에서는 모델이 현재 필요한 중간값을 텍스트 안에서 반복해 적고 여러 Attention Head에 복사해 저장하므로, 일부 캐시 항목이 삭제되어도 정보가 남는다고 정리합니다.
PagedAttention
긴 생성 과정의 KV 캐시를 페이지 단위로 관리해 여러 요청의 GPU 메모리 사용을 조정하는 방식입니다. 이 논문에서는 vLLM의 서빙 환경에서 캐시 압축과 함께 사용하며, 캐시 용량이 늘어나는 요청 수와 처리량에 직접 영향을 줍니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 03.수집 2026. 09. 05.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.