본문으로 건너뛰기

Declarative Attention으로 KV 캐시 읽기 줄이기

Declarative Attention은 모델이 필요한 문맥 위치를 선언하게 해 장문 생성의 KV 캐시 접근량을 최대 52.0% 줄입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

장문 대화에서 언어 모델은 실제로 소수의 토큰만 주로 참조하지만, 기존 방식에서는 매 생성 단계마다 전체 KV 캐시를 읽어야 해 문맥 길이에 비례한 비용이 발생합니다. Declarative Attention은 모델이 Chain-of-Thought 안에서 필요한 문맥 위치를 직접 선언하게 하고, 추론 엔진이 이를 도구 호출처럼 해석해 전체 문맥·특정 구간·최근 출력만 참조하는 세 가지 모드로 KV 캐시 읽기를 제한합니다. 15개 장문 문맥 과제의 제로샷 평가에서 Gemma-4-31B는 접근 토큰을 52.0%, Qwen-3.6-27B는 31.1% 줄였으며 정확도 하락은 각각 1.27pp와 2.75pp였습니다. 정확도 손실은 모델 규모가 커질수록 줄어드는 경향을 보였지만, 추가 학습을 통한 개선 가능성은 후속 과제로 남았습니다.

섹션별 상세

01
1M 토큰 대화에서 사용자가 과거의 특정 세부 사항을 물으면 글로벌 Attention 계층은 답변의 각 토큰을 생성할 때 전체 문맥을 훑어야 합니다. 기존의 대표적인 완화 방식은 가벼운 proxy score로 관련 토큰을 미리 고르지만, 매 단계마다 O(N) 규모의 외부 점수 계산이 추가됩니다. 이 글은 모델이 이미 어떤 문맥이 필요한지 알고 있다는 점에 착안해 별도의 점수 계산 대신 모델 내부의 선언을 활용합니다.
02
Declarative Attention은 모델이 Chain-of-Thought 안에서 다음 생성에 필요한 위치를 선언하도록 유도하고, 추론 엔진은 그 선언을 tool call처럼 파싱합니다. 선언에 따라 전체 문맥, 특정 문맥 구간, 최근 출력만 참조하는 세 가지 모드로 생성 범위를 나누며, 선택되지 않은 KV 캐시 읽기를 건너뜁니다. 따라서 핵심 변화는 외부 모듈이 관련 토큰을 추정하는 방식에서 모델의 생성 과정이 필요한 Attention 범위를 직접 지정하는 방식으로 옮겨간 점입니다.
03
15개 장문 문맥 과제의 제로샷 평가에서 Declarative Attention은 off-the-shelf 모델에도 적용됐습니다. Gemma-4-31B에서는 디코딩 중 총 접근 토큰이 52.0% 감소했고 정확도 하락은 1.27pp였으며, Qwen-3.6-27B에서는 접근 토큰이 31.1% 줄고 정확도 하락은 2.75pp였습니다. 정확도 손실이 모델 규모와 함께 줄어드는 경향은 모델이 문맥 위치를 선언하는 능력이 더 큰 모델에서 효율적으로 작동할 가능성을 뒷받침하지만, 글에 제시된 결과만으로 모든 장문 과제에서 동일한 비율을 보장할 수는 없습니다.

용어 해설

KV 캐시(KV Cache)
Transformer가 이전 토큰의 Key와 Value 표현을 저장해 다음 토큰 생성 때 재계산을 피하는 메모리 구조입니다. 긴 문맥에서는 저장된 전체 KV 캐시를 읽는 비용이 커지므로, 실제로 필요한 토큰만 선택해 읽으면 디코딩 속도와 메모리 접근량을 줄일 수 있습니다.
희소 어텐션(Sparse Attention)
모든 문맥 토큰을 매번 참조하지 않고 일부 토큰이나 구간만 선택해 Attention을 수행하는 방식입니다. 계산량과 메모리 접근을 줄이는 대신 중요한 정보가 선택에서 빠질 위험이 있어 정확도와 효율 사이의 균형이 필요합니다.
사고 연쇄(Chain-of-Thought)
언어 모델이 답을 생성하기 전에 내부적으로 이어 가는 추론 과정 또는 그 형식의 텍스트입니다. Declarative Attention은 이 과정에서 모델이 다음 생성에 필요한 문맥 위치를 선언하도록 유도해 Attention 범위를 조절합니다.
제로샷 평가(Zero-Shot Evaluation)
특정 과제에 맞춘 추가 Fine-tuning이나 예시 학습 없이 이미 학습된 모델을 평가하는 방법입니다. 이 글에서는 별도 학습을 거치지 않은 모델에 Declarative Attention을 적용하고 15개 장문 문맥 과제에서 토큰 접근량과 정확도 변화를 측정했습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 05.수집 2026. 09. 05.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.