본문으로 건너뛰기

효율적인 긴 컨텍스트 생성을 위한 컨텍스트 기억화

긴 컨텍스트에서 prefix를 재사용할 때 매 스텝마다 prefix에 대한 self-attention이 필요하면 비용과 지연이 증가한다. Attention-State Memory(ASM)는 training-free로 prefix를 memory에 외부화하고 inference 시 조회하여 prefix-attention을 제거한다. ManyICLBench와 NBA 벤치마크에서 ASM은 1K–8K 메모리 예산에서 ICL 대비 성능을 유지하거나 향상시키고 prefix-attention 지연을 감소시킨다.

용어 해설

Attention-State Memory
길이가 긴 고정 prefix와 query 토큰 간의 어텐션 출력을 미리 계산해 저장하는 메모리로, 인퍼런스 시 조회하여 prefix-attention을 대체한다. 각 레이어별로 q бар, a_bar, Z_bar를 엔트리로 구성하고 prefix 재사용에 활용한다.
Prefix 감소(Prefix Decay)
생성 진행 중 프리픽스의 영향이 토큰 간 어텐션 분산으로 인해 약화되는 현상으로, 긴 컨텍스트에서 prefix의 기여도가 점차 감소한다.
KV 캐시(KV Cache)
Transformer에서 키(K)와 값(V) 캐시를 사용해 재사용 가능한 어텐션 정보를 저장하는 기법으로, ASM의 구성과 관리에 관여한다.
온라인 소프트맥스 아이덴티티(Online-Softmax Identity)
질의(q)와 멀티블록(KV) 간의 attention을 분해하고 각 블록의 상태를 합성해 손실 없이 prefix 정보를 재구성하는 수학적 원리.
GQA(그룹드-쿼리 어텐션)(GQA (Grouped-Query Attention))
группы 쿼리 헤드가 동일 KV 헤드를 공유하는 구조에서, 그룹별로 aggregated queries를 수집·클러스터링해 centroid를 구성하는 기술로 ASM의 확장에 적용된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 18.수집 2026. 05. 21.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.