TL;DR
LLM 추론은 입력 문맥을 병렬 처리해 KV cache를 만드는 Prefill과, 그 상태를 읽으며 출력 토큰을 하나씩 생성하는 Decode로 나뉩니다. Prefill은 첫 토큰 지연인 TTFT에, Decode는 토큰 사이 간격인 ITL과 전체 완료 시간에 주로 영향을 주지만 대기열·네트워크·동시성도 같은 증상을 만들 수 있습니다. 긴 문맥·RAG 요청에는 입력 토큰 분포와 TTFT를, 긴 출력에는 ITL과 출력 길이를, 혼합 트래픽에는 대표 조건의 p95·p99를 측정해야 합니다. 최적화는 실제 요청 경로를 재현한 뒤 batching, chunked prefill, KV-cache 관리, speculative decoding, 단계별 자원 분리의 비용과 운영 복잡성을 비교하는 순서로 진행해야 합니다.
섹션별 상세
- LLM 추론은 Prefill과 Decode라는 서로 다른 두 단계로 구성되며 각각 입력 처리와 출력 생성을 맡는다. — 기사 도입부의 ‘LLM inference has two phases’ 문단과 Prefill·Decode 작동 원리 절
- Prefill은 일반적으로 연산 중심이고 Decode는 순차 생성과 메모리 대역폭의 영향을 크게 받는다. — ‘The phases have different access patterns’ 문단에서 입력 토큰 병렬 처리와 이전 토큰 의존성을 비교한 부분
- TTFT, ITL, end-to-end latency, throughput은 서로 다른 사용자 경험과 시스템 성능 질문에 답한다. — ‘How the two phases show up in latency and throughput’ 절의 지표 정의와 trade-off 설명
- 긴 문맥·검색 중심 요청은 TTFT와 입력 토큰 분포를, 긴 출력 요청은 ITL과 출력 길이를 우선 측정해야 한다. — ‘Start with the workload shape’ 절의 long-context, retrieval-heavy, long-output workload 문단

- 대표적인 입력·출력 길이와 동시성 조건에서 p95·p99를 측정해야 실제 운영 성능을 평가할 수 있다. — ‘Test the request path your users actually take’ 절의 벤치마크 항목과 비교 조건
용어 해설
- Prefill
- — LLM이 입력 문맥 전체를 처리해 첫 출력 토큰을 생성할 준비를 하는 단계입니다. 입력 토큰을 병렬 처리하고 KV cache를 구축하므로 일반적으로 연산량과 TTFT에 큰 영향을 줍니다.
- Decode
- — Prefill 이후 LLM이 KV cache를 참조하면서 출력 토큰을 하나씩 순차 생성하는 단계입니다. 이전 토큰에 의존하고 메모리를 반복해서 읽기 때문에 스트리밍 속도와 ITL에 직접 연결됩니다.
- KV Cache
- — 입력 문맥을 처리하는 동안 생성되는 요청별 serving 상태로, 모델이 출력 토큰을 만들 때 반복 참조합니다. 응답이 길어질수록 상태가 커져 메모리 압력과 동시 처리 용량에 영향을 줍니다.
- 첫 토큰 지연시간(Time to First Token)
- — 사용자가 요청을 보낸 뒤 스트리밍 응답의 첫 토큰이 도착할 때까지 걸리는 시간입니다. 긴 입력, 검색 결과, 대화 기록뿐 아니라 대기열과 네트워크 경로도 이 값을 늘릴 수 있습니다.
- 토큰 간 지연시간(Inter-token Latency)
- — 스트리밍 응답에서 연속된 출력 토큰 사이의 간격입니다. TTFT가 짧아도 ITL이 길거나 불규칙하면 사용자는 응답을 끊기는 흐름으로 느끼므로 Decode 성능을 별도로 확인해야 합니다.
- 청크형 Prefill(Chunked Prefill)
- — 큰 입력 문맥을 여러 작은 조각으로 나누어 처리하면서 이미 진행 중인 Decode 작업과 번갈아 실행하는 방식입니다. 대형 입력이 스트리밍 응답을 방해하는 현상을 줄일 수 있지만 효과는 요청 구성과 스케줄링 정책에 좌우됩니다.
기술
- LLM
- KV cache
- RAG
- in-flight batching
- Chunked Prefill
- Speculative Decoding
- Disaggregated Serving
- GPU
활용 사례
- 긴 대화 기록과 검색 결과를 사용하는 RAG 애플리케이션의 첫 토큰 지연 측정
- 코드 생성과 초안 작성처럼 출력이 긴 스트리밍 워크플로의 ITL 측정
- 여러 요청이 동시에 들어오는 LLM serving 환경의 p95·p99 성능 평가
- 사용자 대기형 서비스와 배치 작업의 latency·throughput 우선순위 비교
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
