탄력적 추론
탄력적 추론은 모델 추론에 필요한 계산 자원을 요청량과 지연 요구에 맞춰 동적으로 증감시키는 방식으로, 유휴 상태에서 리소스를 줄이고 버스트 시점에만 GPU를 확장해 비용과 응답성을 동시에 관리한다. 플랫폼 수준에서는 짧은 시간 동안 GPU를 할당했다가 회수하거나 CPU와 GPU를 혼합해 라우팅하는 전략이 사용되며, 모델 커스텀 추론 엔드포인트와 결합해 실시간 서비스의 비용 효율을 개선한다. 에이전트 워크로드처럼 예측 불가능한 부하 패턴에서 비용과 처리량을 균형 있게 유지하는 데 필수적이다.