섹션별 상세
어텐션 메커니즘은 토큰 간의 상호작용을 계산하며, 프리필 단계에서 전체 프롬프트를 처리하여 첫 번째 토큰을 생성하는 과정에서 막대한 연산량이 발생한다.
KV 캐싱은 이전 단계에서 계산된 Key와 Value 벡터를 메모리에 저장하여 디코딩 시 중복 계산을 방지하고 시간 복잡도를 에서 으로 줄여 추론 속도를 높인다.
청크 프리필은 GPU 메모리 용량을 초과하는 긴 프롬프트를 작은 단위로 분할하여 처리함으로써 시스템의 안정성을 확보하고 유연한 배칭을 가능하게 한다.
래그드 배칭은 어텐션 마스크를 활용해 서로 다른 길이의 시퀀스를 패딩 없이 하나로 결합하여 GPU의 불필요한 연산 낭비를 제거한다.
연속 배칭은 완료된 요청을 즉시 새 요청으로 교체하는 동적 스케줄링을 결합하여 GPU가 유휴 상태 없이 항상 최대 효율로 작동하도록 설계된 기술이다.
용어 해설
- KV 캐시(KV Cache)
- — LLM 추론 시 이전 토큰들의 Key와 Value 벡터를 메모리에 저장해두는 기술이다. 매번 처음부터 다시 계산하지 않고 저장된 값을 재사용함으로써 디코딩 속도를 비약적으로 향상시킨다.
- 프리필(Prefill)
- — 사용자의 입력 프롬프트 전체를 한 번에 처리하여 첫 번째 출력 토큰을 생성하는 초기 단계이다. 입력 길이에 따라 계산량이 급증하며 KV 캐시를 생성하는 역할을 한다.
- 래그드 배칭(Ragged Batching)
- — 길이가 서로 다른 여러 시퀀스를 패딩(Padding) 없이 하나로 이어 붙여 처리하는 방식이다. 어텐션 마스크를 정교하게 조절하여 각 시퀀스가 서로 간섭하지 않게 관리하며 GPU 효율을 높인다.
- 처리량(Throughput)
- — 단위 시간당 시스템이 처리할 수 있는 토큰의 총 개수를 의미한다. LLM 서빙 시스템의 효율성을 측정하는 핵심 지표로, 연속 배칭의 주된 최적화 목표이다.
기술
- Transformer
- KV Cache
- Attention Mask
- Continuous Batching
- Chunked Prefill
활용 사례
- 실시간 챗봇 서비스
- 대규모 RAG 파이프라인
- 동시 접속자가 많은 AI API 서버
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2025. 11. 25.수집 2026. 02. 21.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

