본문으로 건너뛰기
HF Daily Papers조회 1

IndexCache: 계층 간 인덱스 재사용을 통한 희소 어텐션 가속화

긴 문맥을 처리할 때 병목이 되는 희소 어텐션의 인덱서 연산을 획기적으로 줄이는 방법을 제시한다. 계층 간의 유사성을 활용해 성능 저하 없이 추론 속도를 높이고 비용을 절감할 수 있어 실무적 가치가 크다.

용어 해설

희소 어텐션(Sparse Attention)
모든 토큰 간의 관계를 계산하는 대신 중요한 일부 토큰만 선택하여 연산하는 기법이다. 연산 복잡도를 시퀀스 길이의 제곱에서 선형 수준으로 낮추어 긴 문맥 처리를 가능하게 하는 핵심 기술이다.
KV 캐시(KV Cache)
이전 추론 단계에서 계산된 Key와 Value 벡터를 메모리에 저장해 두었다가 재사용하는 기술이다. 매 단계마다 전체 시퀀스를 다시 계산할 필요가 없게 하여 LLM의 생성 속도를 비약적으로 높인다.
지식 증류(Knowledge Distillation)
복잡한 모델(교사)의 출력 분포를 더 단순한 모델(학생)이 모방하도록 학습시키는 기법이다. 본 논문에서는 여러 레이어의 어텐션 정보를 하나의 인덱서가 학습하도록 하는 데 활용된다.
프리필(Prefill)
LLM 추론의 첫 단계로, 입력된 프롬프트 전체를 한꺼번에 처리하여 초기 상태를 생성하는 과정이다. 문맥이 길어질수록 이 단계에서 발생하는 연산 병목 현상이 심화된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 13.수집 2026. 03. 14.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.