TL;DR
ChatGPT의 응답 생성 전 발생하는 지연 시간은 모델의 작동 방식인 두 단계인 Prefill과 Decode의 구조적 차이에서 기인한다. Prefill 단계에서는 전체 프롬프트를 병렬로 처리하며 KV cache를 생성하여 이후 토큰 생성을 위한 메모리를 확보한다. 이어지는 Decode 단계에서는 생성된 KV cache를 참조하여 토큰을 하나씩 순차적으로 출력한다. 긴 프롬프트일수록 Prefill 단계의 연산량이 기하급수적으로 증가하여 초기 지연 시간이 길어지며, 이를 최소화하는 것이 추론 최적화의 핵심이다.
챕터별 상세
ChatGPT의 응답 지연 현상
이 현상은 LLM 추론 과정에서 발생하는 일반적인 지연 시간으로, Time to First Token(TTFT)이라고 불린다.
추론의 두 단계: Prefill과 Decode
Prefill 단계의 작동 원리
KV cache는 모델이 이전 문맥을 기억하기 위해 사용하는 메모리 구조이다.
Decode 단계의 작동 원리
지연 시간의 원인과 최적화
용어 해설
- Prefill
- — LLM 추론의 첫 번째 단계로, 입력된 전체 프롬프트를 병렬로 처리하여 모델의 내부 상태인 KV cache를 생성하는 과정이다. 이 단계에서 연산량이 집중되어 초기 지연 시간이 결정된다.
- Decode
- — LLM 추론의 두 번째 단계로, 생성된 KV cache를 참조하여 다음 토큰을 하나씩 순차적으로 생성하는 과정이다. 이전 토큰에 의존적이므로 병렬 처리가 불가능하다.
- KV Cache
- — 이전 토큰들의 정보를 Key와 Value 형태로 저장한 메모리 공간이다. 매번 프롬프트를 다시 읽지 않고도 이 캐시를 조회하여 다음 토큰을 효율적으로 생성할 수 있게 한다.
- Time to First Token
- — 사용자가 질문을 입력한 시점부터 모델이 첫 번째 토큰을 출력하기까지 걸리는 시간이다. 주로 Prefill 단계의 연산 속도에 의해 결정된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


