TL;DR
LLM과의 대화가 길어질수록 응답 속도가 느려지는 현상은 KV Cache의 누적 때문이다. 모델은 각 토큰마다 Key와 Value 정보를 저장하는데, 대화가 길어질수록 이 캐시가 커져 새로운 토큰을 생성할 때마다 더 많은 데이터를 스캔해야 하므로 연산 시간이 증가한다. 또한 GPU 메모리 한계를 초과하면 성능 저하가 발생하며, 이를 해결하기 위해 대화 요약이나 Paged Attention 같은 기법이 사용된다.
챕터별 상세
대화가 길어질수록 느려지는 이유
KV Cache의 작동 원리
KV Cache는 추론 시 반복적인 연산을 줄이기 위해 중간 상태를 저장하는 메모리 기법이다.
메모리 한계와 성능 저하
해결 방안 및 요약
용어 해설
- KV Cache
- — LLM이 이전 토큰들의 연산 결과인 Key와 Value 값을 메모리에 저장해두는 공간이다. 매번 전체 대화를 다시 계산하지 않고 저장된 값을 참조하여 추론 속도를 높이지만, 대화가 길어질수록 메모리 점유율이 증가하고 연산량이 늘어나는 원인이 된다.
- Attention Mechanism
- — 모델이 입력 시퀀스 내의 각 토큰 간 관계를 파악하는 핵심 알고리즘이다. 새로운 토큰을 생성할 때마다 KV Cache에 저장된 이전 토큰들의 정보를 스캔하여 문맥을 파악하는데, 캐시가 커질수록 스캔 시간이 길어져 성능 저하가 발생한다.
- Token
- — LLM이 텍스트를 처리하는 최소 단위이다. 모델은 각 토큰마다 KV Cache를 생성하여 저장하며, 대화가 길어질수록 토큰 수가 늘어나 캐시 크기가 비례해서 커진다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



