용어 해설
- KV 캐시(KV Cache)
- — Transformer가 이전 토큰의 Key와 Value를 저장해 다음 토큰 생성 때 재사용하는 메모리 구조입니다. 생성 토큰이 늘면 저장 항목도 선형으로 증가하므로 긴 추론에서는 GPU 메모리 병목이 됩니다. KV 캐시 Eviction은 예산을 넘은 항목을 영구 삭제해 메모리를 제한합니다.
- KV 캐시 Eviction(KV Cache Eviction)
- — 고정된 메모리 예산 안에 KV 캐시를 유지하려고 일부 토큰의 Key-Value 쌍을 삭제하는 기법입니다. 각 토큰의 향후 중요도를 점수화한 뒤 상위 항목을 보존하는 방식이 일반적이지만, 삭제된 항목은 이후 복구할 수 없습니다.
- Attention Head
- — Multi-Head Attention을 구성하는 독립적인 부분 모듈입니다. 각 Head는 토큰의 Key-Value 복사본을 별도로 저장하고 현재 Query와의 관련도를 계산합니다. 이 논문에서는 Head별 독립 보존이 추론 흔적의 중복성을 높이는 핵심 구조로 작동합니다.
- 추론 흔적(Reasoning Trace)
- — 모델이 문제를 풀면서 생성하는 중간 추론 토큰의 연속입니다. 논문에서는 모델이 현재 필요한 중간값을 텍스트 안에서 반복해 적고 여러 Attention Head에 복사해 저장하므로, 일부 캐시 항목이 삭제되어도 정보가 남는다고 정리합니다.
- PagedAttention
- — 긴 생성 과정의 KV 캐시를 페이지 단위로 관리해 여러 요청의 GPU 메모리 사용을 조정하는 방식입니다. 이 논문에서는 vLLM의 서빙 환경에서 캐시 압축과 함께 사용하며, 캐시 용량이 늘어나는 요청 수와 처리량에 직접 영향을 줍니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


