본문으로 건너뛰기

Salesforce의 SageMaker Inference Components를 활용한 Multi-AZ 고가용성 확보 전략

Salesforce가 SageMaker Inference Components의 SchedulingConfig를 활용해 모델 배포 시 AZ 간 균형을 맞추고 고가용성을 달성한 사례.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Salesforce는 Agentforce 모델의 고가용성(HA)을 확보하기 위해 SageMaker Inference Components(IC)의 배포 전략을 개선했다. 기존의 기본 배포 방식은 비용 최적화에만 치중하여 가용 영역(AZ) 간 균형이 맞지 않는 단일 장애점 문제를 안고 있었다. 이를 해결하기 위해 SchedulingConfig의 SPREAD 전략과 AvailabilityZoneBalance를 도입하여 모델 복제본을 여러 AZ에 균등하게 분산 배치했다. 결과적으로 Salesforce는 2-AZ 준수 요건을 충족하면서도 인프라 비용 효율성을 유지하고, SageMaker AI Insights를 통해 배포 상태를 실시간으로 모니터링할 수 있게 되었다.

섹션별 상세

01
Salesforce는 Agentforce 모델을 배포할 때 비용 효율성을 위해 SageMaker Inference Components(IC)를 사용했으나, 기본 배포 알고리즘이 가용 영역(AZ) 균형을 고려하지 않아 단일 장애점(Single Point of Failure)이 발생하는 문제가 있었다. 이는 2개 이상의 AZ 지원을 요구하는 내부 규정 준수 요건을 충족하지 못하는 상황이었다.
02
AWS는 CreateInferenceComponent API에 SchedulingConfig 파라미터를 추가하여 IC 배포 시 인스턴스와 AZ 간의 배치를 세밀하게 제어할 수 있도록 했다. AvailabilityZoneBalance로 AZ 간 복제본 분포를 조정하고, PlacementStrategy를 SPREAD로 설정하여 인스턴스 간 복제본을 분산함으로써 장애 격리를 강화했다.
python
response = client.create_inference_component(
InferenceComponentName='salesforce-llm-ic-ha',
EndpointName='salesforce-multiaz-endpoint',
VariantName='AllTraffic',
Specification={
'ModelName': 'salesforce-einstein-llm-v2',
'ComputeResourceRequirements': {
'NumberOfAcceleratorDevicesRequired': 1,
'MinMemoryRequiredInMb': 65536
},
'DataCacheConfig': {'EnableCaching': True},
'SchedulingConfig': {
'PlacementStrategy': 'SPREAD',
'AvailabilityZoneBalance': {
'EnforcementMode': 'PERMISSIVE',
'MaxImbalance': 1
}
}
},
RuntimeConfig={'CopyCount': 4}
)

SPREAD 전략과 AZ 균형 설정을 포함한 Inference Component 생성 코드

03
Salesforce는 MaxImbalance를 0 또는 1로 설정하여 AZ 간 복제본 개수 차이를 최소화하고, SPREAD 전략을 통해 특정 인스턴스 장애가 전체 모델 가용성에 영향을 미치지 않도록 구성했다. 또한 ScaleInPolicy에 CONSOLIDATION 전략을 적용하여 스케일링 과정에서도 AZ 균형이 유지되도록 설계했다.
python
update_response = client.update_inference_component(
InferenceComponentName='salesforce-llm-ic-ha',
RuntimeConfig={'CopyCount': 8} # Scale out: 4 per AZ
)

AZ 균형을 유지하며 복제본 개수를 조정하는 스케일 아웃 코드

python
client.create_endpoint_config(
EndpointConfigName='salesforce-multiaz-endpoint-config-v2',
ProductionVariants=[{
'VariantName': 'AllTraffic',
'InstanceType': 'ml.g5.xlarge',
'InitialInstanceCount': 4,
'ManagedInstanceScaling': {
'Status': 'ENABLED',
'MinInstanceCount': 2,
'MaxInstanceCount': 8,
'ScaleInPolicy': {
'Strategy': 'CONSOLIDATION'
}
}
}]
)

CONSOLIDATION 전략을 적용한 엔드포인트 설정 생성 코드

04
배포 후에는 SageMaker AI Insights의 Reliability 탭을 통해 AZ Skew, 복제본 분포, 재조정 이벤트 등을 지속적으로 모니터링한다. 또한, 온디맨드 용량 예약(ODCR)을 통해 각 AZ에 충분한 GPU 자원을 사전에 확보함으로써 배포 시 용량 부족으로 인한 불균형 발생을 방지했다.

용어 해설

다중 가용 영역 고가용성(Multi-AZ HA)
여러 가용 영역(AZ)에 걸쳐 서비스를 분산 배치하여, 특정 AZ의 장애 발생 시에도 서비스 중단 없이 운영을 지속하는 아키텍처 전략이다.
추론 컴포넌트(Inference Components)
SageMaker에서 여러 모델을 단일 인스턴스에 공동 호스팅하여 GPU 활용도를 높이고 인프라 비용을 절감하는 기능이다.
온디맨드 용량 예약(ODCR)
특정 가용 영역 내에 필요한 컴퓨팅 자원을 사전에 확보하여, 배포 시 자원 부족으로 인한 실패를 방지하는 예약 방식이다.

기술

  • Amazon SageMaker
  • Boto3
  • Agentforce

활용 사례

  • Enterprise AI model deployment
  • Multi-AZ HA
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 29.수집 2026. 08. 29.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.