본문으로 건너뛰기

SeKV: 계층적 시맨틱 메모리를 통한 해상도 적응형 KV 캐시로 장문 컨텍스트 LLM 추론 효율화

SeKV는 엔트로피 기반 스팬 분할과 GPU 요약·CPU 저계수 SVD를 결합해 128K 문맥에서 GPU 메모리를 53.3% 절감하면서 동적 토큰 수준 복원을 통해 압축된 캐시에서 실질적 성능을 회복했다.

용어 해설

키-값 캐시(KV Cache)
Transformer 계열 모델에서 디코딩 중에 각 토큰의 key·value 벡터를 저장해 다음 토큰 예측에 재사용하는 구조로, 컨텍스트 길이에 따라 메모리 사용량이 선형으로 증가해 장문 입력 처리에서 병목이 된다.
시맨틱 스팬(Semantic Span)
문맥을 의미적으로 일관된 구간으로 분할한 단위로, 토큰 서프라이절(확률 기반 경계)로 경계가 정해지면 정보 밀도가 높은 구간을 더 촘촘히 보존하고 낮은 밀도 구간은 더 공격적으로 압축할 수 있다.
저계수 SVD(Low-rank SVD)
스팬 내 토큰 키·값 행렬에 대해 특이값 분해를 수행한 뒤 소수 성분만 보존하여 토큰 수준의 구조를 압축하는 방식으로, CPU에 보관된 저계수 인수분해로부터 필요한 성분만 GPU로 전송해 재구성한다.
토큰 서프라이절(Token Surprisal)
prefill 단계에서 모델이 계산하는 각 토큰의 음의 로그 확률로, 높은 값이 주제 변화나 엔티티 도입처럼 의미적 경계를 나타내는 지표로 활용되어 스팬 분할 기준으로 사용된다.
줌인 메커니즘(Zoom-In Mechanism)
디코딩 시점에 쿼리와 스팬 요약 벡터 간 라우팅 점수로 관련 스팬을 선택하고 CPU에 저장된 저계수 성분을 비동기 전송해 선택된 스팬을 토큰 수준으로 재구성하는 동적 확장 정책이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 30.수집 2026. 07. 08.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.