TL;DR
Amazon SageMaker AI에서 30B Mixture-of-Experts 모델을 G5, G6, G6e, G7 GPU 인스턴스에 배포하고 실제 부하를 기준으로 추론 성능과 비용을 비교했습니다. Qwen3-Coder-30B 벤치마크에서는 동일한 LMI 28.0 구성과 128 입력·출력 토큰, 동시성 4 조건에서 G7이 391.3 tok/s를 기록해 G5보다 13.0%, G6보다 60.8% 높은 출력 토큰 처리량을 냈으며 평균 및 P99 지연 시간도 가장 낮았습니다. NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4에 대한 자동 추천에서는 g7.48xlarge가 최대 처리량 2,397 tok/s를, g7.2xlarge가 채팅 workload 기준 100만 출력 토큰당 $0.90의 최저 비용을 기록했습니다. 다만 결과는 모델, 양자화 형식, 입력 길이, 동시성, 지역과 최적화 목표에 따라 달라지므로 Amazon SageMaker AI의 직접 벤치마크 또는 Generative AI Inference Recommendations를 자체 workload에 적용해야 합니다.
섹션별 상세


from sagemaker.serve import start_benchmark, Workload
workload = Workload.synthetic(
tokenizer=HF_MODEL_ID,
concurrency=4,
request_count=100,
prompt_input_tokens_mean=128,
output_tokens_mean=128,
streaming=False,
)
job = start_benchmark(
endpoint=endpoint,
workload=workload,
role=ROLE,
wait=False,
)SageMaker AI 엔드포인트에 128개 입력·출력 토큰, 동시성 4, 총 100개 요청으로 합성 부하를 생성하고 벤치마크 작업을 시작합니다.
용어 해설
- Mixture-of-Experts
- — Mixture-of-Experts는 여러 Expert 네트워크 중 입력 토큰마다 일부만 활성화하는 모델 구조입니다. 전체 파라미터를 모두 계산하지 않고 선택된 Expert만 처리하므로 계산량을 줄일 수 있지만, 토큰 생성 단계에서는 Expert 가중치를 메모리에서 읽는 속도가 성능을 좌우합니다.
- 메모리 대역폭(Memory Bandwidth)
- — 메모리 대역폭은 GPU가 메모리에서 데이터를 읽고 쓰는 속도를 뜻합니다. MoE 모델의 디코딩에서는 토큰마다 활성화된 Expert 가중치를 반복해서 읽어야 하므로 대역폭이 높을수록 토큰 사이 지연 시간이 줄고 초당 생성 토큰 수가 늘어납니다.
- NVFP4
- — NVFP4는 NVIDIA Blackwell GPU 아키텍처와 함께 도입된 4비트 부동소수점 형식입니다. 가중치를 약 4비트로 표현해 모델 크기를 줄이며, Blackwell Tensor Core의 네이티브 FP4 연산을 사용하면 낮은 정밀도 가중치를 하드웨어 수준에서 가속할 수 있습니다.
- 첫 토큰 지연 시간(Time to First Token)
- — Time to First Token은 요청을 받은 뒤 첫 번째 출력 토큰이 생성될 때까지 걸리는 시간입니다. 스트리밍 애플리케이션에서는 사용자가 생성 결과를 보기 시작하는 시점을 결정하므로, 전체 요청 지연 시간과 별도로 대화형 응답성을 평가하는 핵심 지표로 활용됩니다.
- 검색 증강 생성(Retrieval Augmented Generation)
- — Retrieval Augmented Generation은 외부 문서나 검색 결과를 긴 입력 컨텍스트로 모델에 제공한 뒤 답변을 생성하는 방식입니다. 입력 토큰이 많아지면 모델이 생성 전에 더 많은 컨텍스트를 처리해야 하므로 출력 토큰 처리량이 낮아지고 생성 토큰당 비용이 높아질 수 있습니다.
기술
- Amazon SageMaker AI
- Amazon EC2 G5
- Amazon EC2 G6
- Amazon EC2 G6e
- Amazon EC2 G7
- NVIDIA Blackwell
- NVIDIA AIPerf
- DJL Large Model Inference
- LMI 28.0
- vLLM
- ModelBuilder
- Amazon S3
- Amazon SageMaker Python SDK
- AWS CLI
활용 사례
- Qwen3-Coder-30B 기반 기업용 AI coding assistant
- 코드 생성·디버깅·리팩터링·개발자 copilot
- NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4 기반 기업용 AI assistant
- 질의응답·요약·reasoning workload
- RAG 및 long-context 애플리케이션
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.