본문으로 건너뛰기
HF Daily Papers조회 1

긴 추론을 위한 정보 인지형 KV 캐시 압축(InfoKV)

대형 언어 모델의 긴 문맥 처리에서 KV 캐시 메모리는 입력·생성 길이에 따라 선형으로 증가하여 실무적 제약을 초래한다. 이 논문은 단순히 최근 attention에 의존한 토큰 보존 기준이 장거리 생성에 취약하다는 관찰을 바탕으로, 예측 불확실성(entropy)과 레이어별 표현 변화를 결합해 미래 기여도를 정량화함으로써 필요 토큰만 선별적으로 보전한다. 그 결과 장거리 prefilling과 decoding 시나리오 모두에서 기존 attention 기반 압축 방법보다 전반적으로 우수한 성능을 달성했다.

용어 해설

키-값 캐시(KV Cache)
Transformer 기반 추론에서 이전 토큰의 키와 값 벡터를 보관하는 구조로서, 생성 과정에서 과거 문맥을 빠르게 참조하도록 한다. 긴 문맥에서는 이 KV 캐시가 선형적으로 커지며 메모리와 대역폭 병목을 야기한다. 본 논문에서는 이 캐시를 선택적으로 압축하여 저장 비용을 줄이는 방식을 다룬다.
전향 영향도(Forward Influence)
어떤 토큰을 KV 캐시에서 제거했을 때 향후 생성되는 여러 토큰의 예측 분포가 얼마나 달라지는지를 KL 발산으로 평균한 지표이다. 이 값은 제거된 토큰이 미래 문맥에 미치는 실질적 기여도를 정량화하며 장거리 의존성을 평가하는 근거로 사용된다. 논문에서는 이 측정값으로 attention 기반 중요도와 엔트로피 기반 중요도의 차이를 비교했다.
Top-k 제한 엔트로피(Top-k Restricted Entropy)
모델의 예측 분포에서 확률이 높은 상위 k개 토큰만을 대상으로 엔트로피를 계산하는 방식으로, 전체 어휘에 대한 엔트로피보다 노이즈 민감성이 적고 불확실성 추정이 안정적이다. 본 연구에서는 k=256 설정이 최적으로 관찰되었으며 엔트로피 기반 중요도 산정에 활용되었다. 이 기법은 희박한 확률 질량 문제를 완화한다.
레이어별 표현 변화(Layer-wise Representation Evolution)
모델의 초기 레이어와 최종 레이어 사이에서 동일 토큰의 히든 표현이 얼마나 변화하는지를 코사인 거리로 측정한 값이다. 표현 변화가 크면 해당 토큰이 모델 내부에서 여전히 의미적으로 정제되는 중이라는 신호로 해석되어 미래 생성에 더 큰 기여 가능성이 있다. 논문은 이 값과 엔트로피를 곱해 레이어별 엔트로피 점수를 구성했다.
적응형 예산 할당(Adaptive Budget Allocation)
전체 KV 캐시 예산을 레이어별 누적 엔트로피 비중에 따라 비례 분배하는 전략으로, 불균일한 레이어별 정보량을 반영하여 더 정보가 풍부한 레이어에 더 많은 토큰을 보존한다. 논문은 이 방식이 일부 모델에서 성능을 개선하는 반면 다른 모델에서는 불안정성을 초래할 수 있음을 보고했다. 기본 설정은 일관성 측면에서 균일 할당이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 25.수집 2026. 06. 27.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.