본문으로 건너뛰기
HF Daily Papers조회 2

KV Packet: LLM을 위한 재계산 없는 문맥 독립적 KV 캐싱

RAG 시스템에서 동일한 문서를 여러 번 참조할 때마다 발생하는 중복 계산 문제를 해결합니다. 기존 방식과 달리 모델 수정이나 재계산 없이도 미리 저장된 캐시를 즉시 결합할 수 있어 추론 속도를 획기적으로 높이고 비용을 절감합니다.

용어 해설

키-값 캐시(KV Cache)
Transformer 모델의 추론 과정에서 이전 토큰들의 Key와 Value 행렬을 저장하여 중복 계산을 방지하는 기술이다. 생성 속도를 높이는 핵심 요소이지만, 입력 문맥이 바뀌면 기존 캐시를 재사용하기 어렵다는 한계가 있다.
첫 토큰 생성 시간(TTFT)
사용자의 요청이 입력된 후 모델이 첫 번째 토큰을 출력할 때까지 걸리는 지연 시간이다. RAG 시스템처럼 긴 문서를 처리해야 하는 경우, 문서를 읽고 캐시를 만드는 'prefill' 단계가 길어져 TTFT가 증가하게 된다.
자기 지도 증류(Self-Supervised Distillation)
모델 자신이 생성한 결과물을 정답(Teacher)으로 삼아 모델의 특정 부분(Student)을 학습시키는 방식이다. 별도의 사람이 라벨링한 데이터 없이도 모델 내부의 지식을 전이하거나 특정 구조에 적응시킬 수 있다.
회전식 위치 인코딩(RoPE)
토큰의 위치 정보를 벡터의 회전 변환으로 표현하는 기법이다. 상대적인 위치 관계를 보존하는 특성이 있어, 캐시된 데이터의 위치가 바뀌더라도 회전 연산만으로 위치 정보를 수정할 수 있게 해준다.

코드 예제

python
k_shifted = RoPE_rotation(k_cached, delta)

RoPE를 사용하여 캐시된 Key 벡터의 위치 인덱스를 새로운 문맥에 맞춰 조정하는 연산 예시

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 14.수집 2026. 04. 18.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.