섹션별 상세
전통적인 정적 배치는 요청이 완료되어도 해당 슬롯을 다른 요청에 재할당할 수 없어 GPU 자원이 낭비된다.
근거
- Static batching wastes memory and compute empty padding tokens. — Static Batching 섹션
In-flight Batching은 토큰 생성 반복마다 배치를 동적으로 재구성하여 완료된 요청의 슬롯에 새로운 요청을 즉시 투입한다.
근거
- In-flight batching is also called continuous batching or iteration-level batching. — In-flight Batching 섹션
각 요청은 Prefill(프롬프트 처리)과 Decode(토큰 생성) 단계를 거치며, 서버는 KV 캐시를 통해 이전 토큰 정보를 유지한다.
이 기술은 GPU 유휴 시간을 최소화하고 처리량을 극대화하며, 긴 응답 시간과 첫 토큰 지연 시간 사이의 균형을 맞춘다.
용어 해설
- KV 캐시(KV Cache)
- — LLM 추론 시 이전 토큰들의 키(Key)와 값(Value) 상태를 GPU 메모리에 저장하는 공간이다. 매 토큰 생성마다 프롬프트를 재계산하지 않도록 하여 연산 효율을 높인다.
- 인플라이트 배치(In-flight Batching)
- — 연속 배치(Continuous Batching)라고도 하며, 토큰 생성 반복(iteration)마다 배치를 동적으로 재구성하는 기법이다. 완료된 요청의 슬롯에 즉시 새로운 요청을 할당하여 GPU 유휴 시간을 최소화한다.
- 정적 배치(Static Batching)
- — 요청들을 고정된 크기의 배치로 묶어 처리하는 방식이다. 배치 내 모든 요청이 완료될 때까지 슬롯을 비워둘 수 없어 GPU 자원 낭비가 발생한다.
기술
- vLLM
- TensorRT-LLM
- NVIDIA Triton
활용 사례
- LLM API 서빙
- 챗봇 서비스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 06. 06.수집 2026. 06. 06.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.