TL;DR
Attention 메커니즘은 Query와 Key의 내적을 통해 정보 간 연관성을 계산하며, Multi-head Attention은 이를 여러 관점에서 분석하여 성능을 높인다. 그러나 추론 시 KV Cache 메모리 사용량이 증가하는 문제가 발생한다. GQA(Group Query Attention)는 여러 Query Head가 하나의 KV Head를 공유하도록 설계하여 KV Cache 크기를 줄이면서도 성능 저하를 최소화한다. 이를 통해 모델의 추론 효율성과 메모리 사용량 간의 균형을 최적화한다.
챕터별 상세
인트로
어텐션의 기본 개념
멀티헤드 어텐션 설명
Group Query Attention(GQA)의 개념과 설계
GQA의 성능 및 마무리
용어 해설
- 어텐션 메커니즘(Attention Mechanism)
- — 입력 시퀀스 내의 각 토큰이 서로 어떤 연관성을 가지는지 계산하는 기술이다. Query와 Key의 내적을 통해 유사도를 구하고, 이를 바탕으로 Value에 가중치를 부여하여 문맥을 파악한다.
- KV 캐시(KV Cache)
- — LLM 추론 시 이전 토큰들의 Key와 Value 값을 메모리에 저장해두는 기법이다. 매번 처음부터 계산하지 않아도 되어 추론 속도를 높이지만, 메모리 사용량이 크다는 단점이 있다.
- 멀티헤드 어텐션(Multi-head Attention)
- — 어텐션 메커니즘을 여러 개의 Head로 병렬화하여 수행하는 방식이다. 각 Head가 서로 다른 관점에서 정보를 분석하여 문맥 이해도를 높인다.
- 소프트맥스(Softmax)
- — 입력받은 값들을 0과 1 사이의 확률값으로 변환하는 함수이다. 합이 1이 되도록 정규화하여 가중치 분포를 만드는 데 사용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



