섹션별 상세
스케일링 법칙이 사전 학습을 넘어 사후 학습(SFT/RL)과 테스트 시간 컴퓨팅으로 확장되면서 인프라 요구사항이 수렴하고 있습니다. 기존에는 데이터셋과 파라미터 크기 증대에 집중했으나, 이제는 추론 시 '긴 생각'을 위한 연산량 증대와 정교한 사후 학습을 위해 밀접하게 결합된 가속기 클러스터가 필수적입니다. NVIDIA의 3대 스케일링 법칙 프레임워크에 따라 사전 학습, 사후 학습, 추론 단계 모두에서 고대역폭 네트워크와 분산 저장소가 공통적으로 요구됩니다.

AWS는 NVIDIA H100, H200 및 최신 Blackwell B200/B300 GPU를 탑재한 EC2 인스턴스를 통해 강력한 컴퓨팅 기반을 제공합니다. P6 인스턴스 제품군은 B200 GPU 8개를 탑재하여 FP8 기준 4.5 PFLOPS의 성능과 180GB HBM3e 메모리를 제공하며, 인스턴스당 최대 400-800 GB/s의 EFA 대역폭을 지원합니다. 이러한 하드웨어 사양은 모델 규모가 커짐에 따라 발생하는 연산 및 메모리 대역폭 병목 현상을 직접적으로 해결합니다.
네트워크 계층에서는 EFA(Elastic Fabric Adapter)와 NVLink가 각각 노드 간 및 노드 내 통신을 담당하여 분산 학습의 효율을 높입니다. EFAv4는 이전 세대 대비 집합 통신 성능을 18% 개선했으며, SRD 프로토콜을 통해 OS 바이패스 RDMA 기능을 제공하여 지연 시간을 최소화합니다. 특히 GB200 NVL72 기반의 UltraServer는 NVLink 도메인을 72개 GPU까지 확장하여 성능에 민감한 통신이 패브릭 외부로 나가는 빈도를 줄입니다.

근거
- EFAv4는 EFAv3 대비 집합 통신 성능을 약 18% 향상시킨다. — Infrastructure: Compute, Network, and Storage 섹션의 EFA 버전 비교 설명
- P6e-GB200 UltraServer는 단일 NVLink 도메인 내에서 최대 72개의 Blackwell GPU를 연결한다. — Amazon EC2 UltraServers 설명 문단
리소스 오케스트레이션은 HPC 중심의 Slurm과 클라우드 네이티브인 Kubernetes(EKS) 두 가지 경로로 최적화되어 제공됩니다. Slurm은 다중 노드 작업을 원자적으로 할당하는 갱 스케줄링(Gang Scheduling)에 강점이 있으며, Kubernetes는 Kueue나 Volcano 같은 프로젝트를 통해 배치 큐잉과 토폴로지 인식 기능을 보완합니다. Amazon SageMaker HyperPod는 두 방식 모두를 지원하며 자동 노드 복구 및 체크포인트 없는 학습(Checkpointless training) 기능을 통해 대규모 클러스터 운영 부담을 낮춥니다.
ML 소프트웨어 스택은 커널 드라이버부터 PyTorch 프레임워크, vLLM/SGLang 같은 추론 엔진까지 5개 계층으로 구성됩니다. NCCL 라이브러리는 aws-ofi-nccl 플러그인을 통해 EFA의 성능을 활용하며, MoE 모델에서 중요한 all-to-all 통신을 최적화합니다. 추론 단계에서는 PagedAttention을 사용하는 vLLM과 접두사 재사용을 지원하는 SGLang이 결합되어 처리량과 지연 시간을 동시에 개선합니다.

근거
- veRL의 HybridFlow 아키텍처는 FSDP2 학습 백엔드와 vLLM 추론 엔진을 동일 작업 내에서 혼합하여 사용할 수 있게 한다. — Distributed training and inference frameworks 섹션의 veRL 설명
대규모 시스템의 안정성을 위해 Prometheus와 Grafana 기반의 통합 관측성 계층이 필수적으로 운영됩니다. DCGM-Exporter를 통해 GPU의 SM 활성도, 메모리 사용량, XID 오류 등을 실시간으로 수집하여 하드웨어 결함을 조기에 감지합니다. 특히 XID 63(행 재매핑 실패)이나 XID 94 같은 치명적 오류를 모니터링하여 장애가 발생한 노드를 즉시 교체함으로써 학습 중단 시간을 최소화합니다.
기술
- AWS P5/P6 Instances
- EFA
- PyTorch
- NCCL
- Slurm
- Kubernetes
- vLLM
- Prometheus
- Grafana
활용 사례
- 대규모 언어 모델(LLM) 사전 학습
- RLHF 기반 사후 학습 파이프라인 구축
- 고성능 분산 추론 서비스 서빙
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 05. 12.수집 2026. 05. 12.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.