TL;DR
PagedAttention은 LLM 추론 시 발생하는 KV cache 메모리 관리 문제를 해결하기 위해 등장한 기술이다. 기존 방식은 요청마다 연속적인 메모리 공간을 할당해야 하므로 외부 단편화가 발생하고 메모리 낭비가 심했다. PagedAttention은 운영체제의 페이징 기법을 차용하여 KV cache를 고정 크기의 블록으로 나누고, 블록 테이블을 통해 비연속적인 물리 메모리를 논리적으로 연결한다. 이를 통해 메모리 낭비를 최소화하고 더 많은 요청을 동시에 처리하여 추론 처리량을 크게 향상시킨다.
챕터별 상세
면접 질문으로 보는 PagedAttention
GPU 메모리 구성 요소
KV cache 메모리 관리 문제
PagedAttention 작동 원리
사무실 비유를 통한 이해
요약 및 결론
용어 해설
- 키-값 캐시(KV Cache)
- — LLM 추론 시 이전 토큰들의 연산 결과를 저장하여 중복 계산을 방지하는 메모리 영역이다. 생성 과정에서 토큰이 늘어날수록 메모리 점유량이 증가하며, 효율적인 관리가 추론 성능의 핵심이다.
- 추론(Inference)
- — 학습된 AI 모델에 입력을 주어 결과를 생성하는 과정이다. LLM에서는 텍스트를 입력받아 다음 토큰을 순차적으로 생성하는 작업을 의미하며, 높은 처리량과 낮은 지연 시간이 요구된다.
- 단편화(Fragmentation)
- — 메모리 할당 과정에서 사용 가능한 메모리 공간이 작은 조각으로 나뉘어, 실제로는 충분한 총 용량이 있음에도 연속적인 공간 부족으로 할당이 불가능한 현상이다.
- 페이징(Paging)
- — 운영체제에서 메모리를 고정 크기의 페이지 단위로 나누어 관리하는 기법이다. 비연속적인 물리 메모리를 논리적으로 연속된 주소 공간으로 매핑하여 메모리 효율을 극대화한다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




