TL;DR
LLM 추론 시 KV Cache는 생성 길이를 예측할 수 없어 최대 길이만큼 메모리를 미리 할당하는 구조적 한계로 인해 메모리 파편화와 낭비가 발생한다. PagedAttention은 운영체제의 가상 메모리 페이징 기법을 차용하여 KV Cache를 고정 크기의 물리적 블록으로 나누고, Block Table을 통해 이를 논리적으로 연결하여 비연속적인 메모리 할당을 가능하게 한다. 이 기술은 메모리 낭비를 획기적으로 줄이고 동일 GPU에서 더 많은 요청을 처리할 수 있게 하며, 유사한 요청 간 메모리 공유를 통해 추론 효율성을 극대화한다.
챕터별 상세
KV Cache의 메모리 낭비 문제
KV Cache는 이전 토큰의 정보를 재사용하기 위해 필수적이지만, 고정된 최대 길이 할당 방식이 메모리 효율을 저해한다.
PagedAttention의 작동 원리
운영체제의 페이징 개념을 LLM 추론 메모리 관리에 적용하여 파편화 문제를 해결했다.
PagedAttention의 성능 이점
메모리 효율화는 곧 추론 처리량(throughput)의 증가로 이어진다.
용어 해설
- KV 캐시(KV Cache)
- — LLM 추론 시 어텐션 레이어의 중간 연산 결과인 Key와 Value를 저장하여 재계산을 방지하는 메모리 공간이다. 문장 생성 시 이전 토큰의 정보를 재사용하여 속도를 높이지만, 생성 길이를 예측하기 어려워 메모리 할당 효율이 낮다는 단점이 있다.
- 페이즈드 어텐션(PagedAttention)
- — 운영체제의 가상 메모리 페이징 기법을 차용하여 KV 캐시를 블록 단위로 관리하고 메모리 파편화를 최소화하는 기술이다. 비연속적인 메모리 공간을 논리적으로 연결하여 메모리 낭비를 줄이고 추론 처리량을 높인다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
