본문으로 건너뛰기

LLM 서빙과 멈추지 않는 버스: In-flight Batching의 원리

LLM 서빙 시 GPU 유휴 시간을 최소화하고 처리량을 극대화하기 위해 요청 단위가 아닌 반복 단위로 배치를 동적으로 재구성하는 In-flight Batching 기술을 다룬다.

섹션별 상세

전통적인 정적 배치는 요청이 완료되어도 해당 슬롯을 다른 요청에 재할당할 수 없어 GPU 자원이 낭비된다.
근거
  • Static batching wastes memory and compute empty padding tokens. Static Batching 섹션
In-flight Batching은 토큰 생성 반복마다 배치를 동적으로 재구성하여 완료된 요청의 슬롯에 새로운 요청을 즉시 투입한다.
근거
  • In-flight batching is also called continuous batching or iteration-level batching. In-flight Batching 섹션
각 요청은 Prefill(프롬프트 처리)과 Decode(토큰 생성) 단계를 거치며, 서버는 KV 캐시를 통해 이전 토큰 정보를 유지한다.
이 기술은 GPU 유휴 시간을 최소화하고 처리량을 극대화하며, 긴 응답 시간과 첫 토큰 지연 시간 사이의 균형을 맞춘다.

용어 해설

KV 캐시(KV Cache)
LLM 추론 시 이전 토큰들의 키(Key)와 값(Value) 상태를 GPU 메모리에 저장하는 공간이다. 매 토큰 생성마다 프롬프트를 재계산하지 않도록 하여 연산 효율을 높인다.
인플라이트 배치(In-flight Batching)
연속 배치(Continuous Batching)라고도 하며, 토큰 생성 반복(iteration)마다 배치를 동적으로 재구성하는 기법이다. 완료된 요청의 슬롯에 즉시 새로운 요청을 할당하여 GPU 유휴 시간을 최소화한다.
정적 배치(Static Batching)
요청들을 고정된 크기의 배치로 묶어 처리하는 방식이다. 배치 내 모든 요청이 완료될 때까지 슬롯을 비워둘 수 없어 GPU 자원 낭비가 발생한다.

기술

  • vLLM
  • TensorRT-LLM
  • NVIDIA Triton

활용 사례

  • LLM API 서빙
  • 챗봇 서비스
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 06.수집 2026. 06. 06.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.