챕터별 상세
00:00
지연 시간과 사용자 경험
사용자는 500ms 이상의 지연 시간을 인지하며 1초 이상 소요될 경우 서비스를 이탈한다. 모델이 다른 데이터 센터에 위치할 경우 발생하는 75ms의 네트워크 지연은 전체 파이프라인에서 30%의 오버헤드를 차지한다. 모든 구성 요소를 동일한 건물 내에 배치하여 네트워크 지연을 5ms 수준으로 단축해야 한다.
00:00
LLM 및 파이프라인 최적화
LLM은 200-300ms의 TTFT를 목표로 8B에서 30B 파라미터 범위의 모델을 사용한다. 더 큰 모델은 지연 시간 예산을 초과하며, 너무 작은 모델은 도구 호출 능력이 부족하다. 음성 인식(STT)은 P90 기준 100ms 미만의 지연 시간과 약 6%의 WER을 목표로 설정한다.
TTFT(Time To First Token)와 WER(Word Error Rate)은 실시간 AI 성능 측정의 핵심 지표이다.
00:00
효율적인 워크플로 설계
복잡한 워크플로를 처리하면서 지연 시간을 줄이기 위해 소형 모델을 대화 흐름 제어용으로 사용한다. 소형 모델이 대화를 주도하다가 복잡한 요청이 발생할 때만 대형 모델을 호출하여 빠른 응답 경로를 유지한다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 06. 01.수집 2026. 06. 01.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


