용어 해설
- 프리필링(Prefilling)
- — LLM이 사용자 입력을 받아 첫 번째 토큰을 생성하기 전까지 전체 입력 시퀀스를 처리하고 KV 캐시를 생성하는 단계이다. 시퀀스 길이에 따라 연산량이 제곱으로 늘어나 병목이 발생한다.
- 희소 어텐션(Sparse Attention)
- — 모든 토큰 간의 관계를 계산하는 대신, 정보 가치가 높은 일부 토큰 쌍의 관계만 선택적으로 계산하여 연산량과 메모리 사용량을 줄이는 기법이다.
- 첫 토큰 생성 시간(TTFT)
- — 사용자가 프롬프트를 입력한 시점부터 모델이 첫 번째 응답 토큰을 출력할 때까지 걸리는 지연 시간이다. 실시간 서비스의 사용자 경험을 결정하는 핵심 지표이다.
- KV 캐시(KV Cache)
- — 이전 토큰들의 Key와 Value 행렬을 메모리에 저장해 두어 다음 토큰 생성 시 중복 계산을 방지하는 기술이다. 롱 컨텍스트 환경에서 메모리 점유율이 매우 높다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
