용어 해설
- RAG
- — Retrieval-Augmented Generation의 약자로, 생성 과정에서 외부 지식 소스를 검색해 보강하는 기법이다. 본 논문 맥락에서 KV 캐시/어텐션 설계와 직접적인 연관은 있지만, 이 용어는 참고 용도로 제시되며 핵심 제안은 GQLA의 경로 구성이다.
- Generalized Multi-Query Attention(GQA)
- — 다수의 쿼리를 공유하는 어텐션 구조로, 그룹 단위의 캐시를 확장하여 GQA 경로를 구현하는 기술이다. MLA의 잠재 압축과 결합해 두 경로의 동시 실행을 가능하게 한다.
- RoPE
- — Rotary Position Embedding으로, 위치 정보를 고정된 차원 내에서 회전으로 표현하는 방법이다. GQLA에서 RoPE는 per-head RoPE 기반의 정렬을 돕기 위해 사용된다.
- FreqFold
- — RoPE 주파수 대역별로 PCA를 수행해 NoPE 부분과 RoPE 부분을 분리하는 기법으로, 업프로젝션의 저랭크 분해에 기여한다.
- 주성분분석(PCA)
- — 고유벡터 기반 차원 축소 기법으로, 그룹별 K/V를 독립적으로 분해해 저랭크 근사로 재구성하는 데 사용된다.
- KV 캐시(KV cache)
- — 토큰 생성 시 이전 토큰들의 Key/Value를 캐시하는 공간으로, KV 캐시의 트래픽이 반복적인 디코딩에서 병목의 주요 원인이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.






