본문으로 건너뛰기

Persistent inference

지속적 추론 아키텍처

모델을 요청마다 새로 로드하지 않고 장시간 살아있는 프로세스에 적재해 두고 추론을 처리하는 방식입니다. 초기에는 모델 로딩과 그래프 초기화에 시간이 소요되지만 이후 요청은 경량화된 엔드포인트처럼 처리됩니다. 서비스형 단순 배포나 짧은 응답 지연이 요구되는 환경에서 비용과 지연을 줄일 수 있습니다.