용어 해설
- Attention-State Memory
- — 길이가 긴 고정 prefix와 query 토큰 간의 어텐션 출력을 미리 계산해 저장하는 메모리로, 인퍼런스 시 조회하여 prefix-attention을 대체한다. 각 레이어별로 q бар, a_bar, Z_bar를 엔트리로 구성하고 prefix 재사용에 활용한다.
- Prefix 감소(Prefix Decay)
- — 생성 진행 중 프리픽스의 영향이 토큰 간 어텐션 분산으로 인해 약화되는 현상으로, 긴 컨텍스트에서 prefix의 기여도가 점차 감소한다.
- KV 캐시(KV Cache)
- — Transformer에서 키(K)와 값(V) 캐시를 사용해 재사용 가능한 어텐션 정보를 저장하는 기법으로, ASM의 구성과 관리에 관여한다.
- 온라인 소프트맥스 아이덴티티(Online-Softmax Identity)
- — 질의(q)와 멀티블록(KV) 간의 attention을 분해하고 각 블록의 상태를 합성해 손실 없이 prefix 정보를 재구성하는 수학적 원리.
- GQA(그룹드-쿼리 어텐션)(GQA (Grouped-Query Attention))
- — группы 쿼리 헤드가 동일 KV 헤드를 공유하는 구조에서, 그룹별로 aggregated queries를 수집·클러스터링해 centroid를 구성하는 기술로 ASM의 확장에 적용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


