TL;DR
Amazon SageMaker HyperPod가 Amazon EKS에서 Ray 클러스터 생성, 원격 작업 제출, JupyterLab·Code Editor 연결, Grafana 관측성을 SageMaker Studio에 통합했습니다. KubeRay와 표준 Ray API를 사용하므로 기존 스크립트를 바꾸지 않고 HyperPod 인프라의 노드 자동 복구, 멈춘 작업 감지, 계층형 체크포인트 저장을 활용할 수 있습니다. SageMaker JumpStart 모델은 Ray Serve endpoint로 직접 배포할 수 있고 Managed Tiered KV Cache는 CPU 메모리와 HyperPod Tiered Storage에 KV 벡터를 저장해 장문 추론의 초기 토큰 지연을 줄입니다. 이 기능을 사용하려면 HyperPod EKS cluster와 SageMaker Spaces·Observability·KubeRay·Ray Endpoint Operator 구성 요소, SageMaker Studio domain이 필요합니다.
섹션별 상세



$ aws eks update-kubeconfig --name --region $ pip install toolkit-for-ray-on-sagemaker-ai $ ray job submit --address sagemaker_ray:/// \ --working-dir \ --python your-code.py # To list ray jobs $ ray job list --address sagemaker_ray:///IAM 인증과 SageMaker-aware 주소 resolver를 사용해 원격 Ray 작업을 제출하고 작업 목록을 조회합니다.
ray.init(address="auto")HyperPod JupyterLab 또는 Code Editor가 연결된 Ray 클러스터에 노트북을 초기화합니다.
import ray
from ray.train.torch import TorchTrainer
from ray.train import ScalingConfig, RunConfig
# address="auto" connects to the Ray cluster attached to this Space
ray.init(runtime_env={"pip": ["torchvision", "pillow"]})
def train_func(config):
...
# Scale to 4 GPU workers
trainer = TorchTrainer(
train_func,
train_loop_config={"epochs": 10},
scaling_config=ScalingConfig(num_workers=4, use_gpu=True),
run_config=RunConfig(storage_path="/fsx/checkpoints"),
)
result = trainer.fit()노트북에서 Ray 클러스터를 초기화하고 runtime_env로 의존성을 주입한 뒤 네 개의 GPU 워커에 PyTorch 학습을 분산 실행합니다.





용어 해설
- Ray 클러스터(Ray Cluster)
- — Ray 작업을 여러 노드와 GPU에 분산 실행하는 클러스터 단위입니다. Kubernetes에서는 KubeRay가 RayCluster 리소스를 바탕으로 헤드 노드와 워커 노드의 생성·확장·삭제 같은 수명주기를 관리합니다. SageMaker Studio에서는 YAML 없이 콘솔에서 클러스터를 만들고 대시보드와 작업 제출 기능을 연결할 수 있습니다.
- KubeRay
- — Kubernetes에서 Ray 클러스터와 작업을 네이티브 리소스로 관리하는 오픈 소스 operator입니다. RayCluster, RayJob, RayService 같은 사용자 정의 리소스를 감시하면서 클러스터 수명주기와 작업 배포를 처리합니다. 이 글에서는 SageMaker HyperPod의 콘솔·관측성·복구 기능과 Ray 표준 API를 연결하는 기반으로 사용됩니다.
- 계층형 체크포인트 저장(Tiered Checkpointing)
- — 학습 체크포인트를 로컬 디스크에 먼저 기록한 뒤 Amazon S3로 비동기 업로드하고, 복구 시 HyperPod Tiered Storage를 우선 조회하는 방식입니다. 최근 체크포인트가 계층형 저장소에 남아 있으면 S3에서 직접 복원하는 과정을 건너뛸 수 있습니다. 노드 교체나 멈춘 작업 재시작 뒤 대규모 모델의 복구 시간을 줄이는 데 쓰입니다.
- KV 캐시(KV Cache)
- — 대규모 언어 모델이 이전 토큰의 attention key-value 벡터를 저장해 후속 토큰 생성에서 반복 계산을 줄이는 메모리 구조입니다. SageMaker HyperPod의 Managed Tiered KV Cache는 각 노드의 CPU 메모리인 L1과 HyperPod Tiered Storage인 L2에 벡터를 나눠 저장합니다. 장문 문서와 다중 턴 대화에서 time-to-first-token을 줄이는 것이 목적입니다.
기술
- Amazon SageMaker HyperPod
- Ray
- KubeRay
- Amazon Elastic Kubernetes Service (Amazon EKS)
- SageMaker Studio
- SageMaker Spaces EKS add-on
- HyperPod Observability EKS add-on
- HyperPod Ray Endpoint Operator
- toolkit-for-ray-on-sagemaker-ai
- JupyterLab
- Code Editor
- Amazon Managed Grafana
- Amazon Managed Service for Prometheus
- Ray Train
- Ray Serve
- vLLM
- SageMaker JumpStart
- Amazon CloudWatch
- Amazon Simple Storage Service (Amazon S3)
- HyperPod Tiered Storage
- Managed Tiered KV Cache
- amzn-sagemaker-checkpointing
활용 사례
- SageMaker Studio에서 Ray 클러스터 생성 및 관리
- JupyterLab·Code Editor 기반의 대화형 분산 학습
- Studio·노트북·CI/CD pipeline에서 원격 Ray 작업 제출
- Amazon Managed Grafana를 이용한 Ray workload 관측성
- 노드 장애와 멈춘 작업에 대한 Ray Train 자동 복구
- SageMaker JumpStart 모델의 Ray Serve 배포
- 장문 문서와 다중 턴 대화를 위한 LLM 추론
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.