섹션별 상세
import boto3
sm = boto3.client("sagemaker")
# Create endpoint config — observability turned on by default
response = sm.create_endpoint_config(
EndpointConfigName="my-llm-config",
ProductionVariants=[{
"VariantName": "primary",
"InstanceType": "ml.g6.4xlarge",
"InitialInstanceCount": 2,
"ManagedInstanceScaling": {
"Status": "ENABLED",
"MinInstanceCount": 2,
"MaxInstanceCount": 8
}
}],
ExecutionRoleArn="arn:aws:iam::123456789012:role/SageMakerExecutionRole"
)SageMaker 엔드포인트 설정 시 상세 관측성(detailed observability)을 활성화하는 예시 코드입니다.

- SageMaker는 GPU 상태, 토큰 수준 지연 시간, KV 캐시 압력 등을 포함한 100개 이상의 상세 추론 메트릭을 제공한다. — SageMaker inference observability overview 섹션




- PromQL 호환 엔드포인트를 통해 Grafana 등 외부 도구에서 SageMaker 메트릭을 직접 쿼리할 수 있다. — Connect to your own observability tool 섹션
용어 해설
- 관측 가능성(Observability)
- — 시스템의 내부 상태를 외부 출력(메트릭, 로그, 추적)을 통해 이해하고 진단하는 능력입니다. 복잡한 분산 시스템에서 성능 병목이나 장애 원인을 빠르게 파악하는 데 필수적입니다.
- KV 캐시(KV Cache)
- — LLM 추론 시 이전 토큰들의 키(Key)와 값(Value) 텐서를 메모리에 저장하는 기법입니다. 매 토큰 생성마다 전체 문맥을 재연산하지 않아도 되어 추론 속도를 획기적으로 높입니다.
- PromQL
- — Prometheus 모니터링 시스템에서 사용하는 쿼리 언어입니다. 시계열 데이터를 선택, 집계, 변환하여 대시보드 시각화나 알람 설정에 활용합니다.
- 첫 토큰 생성 시간(TTFT)
- — Time To First Token의 약자로, 사용자가 요청을 보낸 후 첫 번째 응답 토큰을 받기까지 걸리는 시간입니다. LLM 서비스의 체감 지연 시간을 결정하는 핵심 지표입니다.
기술
- Amazon SageMaker
- Amazon CloudWatch
- OpenTelemetry
- PromQL
- vLLM
- SGLang
- Grafana
활용 사례
- LLM 추론 성능 모니터링
- 추론 엔드포인트 병목 진단
- 멀티 모델 엔드포인트 리소스 최적화
- 고가용성 인프라 관리
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.