본문으로 건너뛰기

SageMaker AI에서 G7과 G5·G6 추론 성능 비교

SageMaker AI 벤치마크에서 G7이 30B MoE 추론의 처리량·지연·토큰 비용 우위를 기록했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Amazon SageMaker AI에서 30B Mixture-of-Experts 모델을 G5, G6, G6e, G7 GPU 인스턴스에 배포하고 실제 부하를 기준으로 추론 성능과 비용을 비교했습니다. Qwen3-Coder-30B 벤치마크에서는 동일한 LMI 28.0 구성과 128 입력·출력 토큰, 동시성 4 조건에서 G7이 391.3 tok/s를 기록해 G5보다 13.0%, G6보다 60.8% 높은 출력 토큰 처리량을 냈으며 평균 및 P99 지연 시간도 가장 낮았습니다. NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4에 대한 자동 추천에서는 g7.48xlarge가 최대 처리량 2,397 tok/s를, g7.2xlarge가 채팅 workload 기준 100만 출력 토큰당 $0.90의 최저 비용을 기록했습니다. 다만 결과는 모델, 양자화 형식, 입력 길이, 동시성, 지역과 최적화 목표에 따라 달라지므로 Amazon SageMaker AI의 직접 벤치마크 또는 Generative AI Inference Recommendations를 자체 workload에 적용해야 합니다.

섹션별 상세

01
생성형 AI 추론 인프라를 고를 때 GPU 세대만 비교하면 실제 성능과 비용을 예측하기 어렵습니다. 모델 구조, 양자화 형식, 입력·출력 토큰 길이와 동시성이 메모리 사용량과 디코딩 속도를 함께 바꾸기 때문입니다. 이 글은 Qwen3-Coder-30B와 NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4를 AWS EC2 G5, G6, G6e, G7 계열에서 실행해 실제 workload에 맞는 구성을 찾는 두 가지 절차를 제시합니다.
02
Amazon SageMaker AI의 벤치마킹 workflow는 이미 배포한 여러 엔드포인트에 동일한 workload를 보내 처리량, 요청 지연 시간, TTFT, ITL과 비용을 비교하는 방식입니다. 추천 workflow는 모델, 후보 인스턴스, workload와 최적화 목표를 입력하면 후보 구성을 실제 GPU에서 평가하고 비용·지연·처리량 기준의 순위와 측정값을 반환합니다. 따라서 전자는 비교할 엔드포인트가 정해진 경우에, 후자는 모델과 workload에 맞는 배포 구성을 탐색하는 경우에 적합합니다.
서로 다른 GPU 인스턴스에 엔드포인트를 배포한 뒤 동일한 workload로 벤치마크하고 성능과 비용을 비교하는 다섯 단계 workflow입니다.
Diagram그림은 Amazon SageMaker AI에서 G5, G6, G7 엔드포인트를 배포하고 Amazon S3의 workload를 SageMaker AI Benchmark Job으로 전송하는 흐름을 나타냅니다. 작업 결과로 TTFT, ITL, P50·P90·P99 요청 지연 시간, 처리량과 비용을 수집한 뒤 가격 대비 성능이 가장 좋은 구성을 선택합니다. 본문의 Qwen3-Coder-30B 직접 벤치마크 절차와 연결됩니다.
모델과 workload, 최적화 목표를 입력해 후보 GPU 구성을 평가하고 순위가 매겨진 배포 추천을 받는 여섯 단계 workflow입니다.
Diagram그림은 NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4 모델과 workload 및 비용·지연·처리량 최적화 목표를 정의하는 단계부터 시작합니다. SageMaker AI Optimization Service가 구성 탐색 공간을 좁히고 실제 GPU에서 후보를 벤치마크한 뒤 순위가 매겨진 추천을 반환하며, 사용자는 결과를 검토해 배포합니다. 본문의 Generative AI Inference Recommendations workflow와 직접 연결되며, 자동 구성 탐색과 수동 엔드포인트 비교의 차이를 시각화합니다.
03
G5, G6, G6e, G7은 NVIDIA GPU 세대와 메모리 용량, 메모리 대역폭, 저정밀도 형식 지원이 서로 다릅니다. MoE 모델의 디코딩은 각 토큰에서 일부 Expert만 활성화하면서도 가중치를 메모리에서 읽는 작업이 반복되므로 메모리 대역폭이 토큰 간 지연 시간과 처리량을 크게 좌우합니다. G7만 Blackwell Tensor Core의 네이티브 FP4 지원을 제공하며, G5와 G6에서는 NVFP4 가중치가 하드웨어 가속 없이 실행되어 G7이 NVFP4 MoE 배포에서 구조적 이점을 가집니다.
python
from sagemaker.serve import start_benchmark, Workload
workload = Workload.synthetic(
    tokenizer=HF_MODEL_ID,
    concurrency=4,
    request_count=100,
    prompt_input_tokens_mean=128,
    output_tokens_mean=128,
    streaming=False,
)
job = start_benchmark(
    endpoint=endpoint,
    workload=workload,
    role=ROLE,
    wait=False,
)

SageMaker AI 엔드포인트에 128개 입력·출력 토큰, 동시성 4, 총 100개 요청으로 합성 부하를 생성하고 벤치마크 작업을 시작합니다.

04
Qwen3-Coder-30B-A3B-Instruct-FP8을 LMI 28.0으로 서비스하고 ml.g5.12xlarge, ml.g6.12xlarge, ml.g7.12xlarge에 같은 조건으로 배포했습니다. 입력 토큰과 출력 토큰 평균을 각각 128, 동시성을 4, 요청 수를 100으로 고정한 뒤 NVIDIA AIPerf 기반 SageMaker AI 벤치마크를 실행해 인스턴스 유형만 비교했습니다. G7은 391.3 tok/s와 3.04 req/s를 기록했고 평균 요청 지연 시간은 1,315.8ms, P99 지연 시간은 1,501.1ms로 세 구성 중 가장 높은 처리량과 가장 낮은 지연 시간을 냈습니다.
05
Qwen3-Coder-30B workload에서 G7은 G6보다 출력 토큰 처리량이 60.8% 높고 평균 지연 시간이 37.6%, P99 지연 시간이 54.7% 낮았습니다. G5와 비교해도 처리량은 13.0% 높았고 평균 지연 시간은 10.8%, P99 지연 시간은 20.2% 낮았습니다. G7은 G5와 G6의 4개 GPU·96GB 구성보다 적은 2개 GPU·64GB 구성으로 이 결과를 냈으며, 스트리밍 조건에서는 평균 TTFT 118.9ms와 평균 ITL 8.9ms를 기록했습니다.
06
NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4 workload에서는 엔드포인트를 먼저 고르는 대신 ModelBuilder와 generate_deployment_recommendations()를 사용해 vLLM 기반 후보 구성을 자동 평가했습니다. 처리량을 최적화 목표로 지정하고 512±50 입력·256±30 출력 토큰의 채팅 workload와 3,500±50 입력·200±20 출력 토큰의 RAG workload를 각각 시험했습니다. SageMaker AI는 후보 GPU 구성의 출력 토큰 처리량, TTFT와 ITL을 측정했고, 글에서는 시간당 인스턴스 가격과 측정 처리량을 이용해 100만 출력 토큰당 비용을 계산했습니다.
07
추천 결과는 처리량과 비용 효율이 서로 다른 구성을 선택할 수 있음을 보여줍니다. 채팅 workload에서 g7.48xlarge가 2,397 tok/s로 최고 처리량을 냈고 g7.2xlarge가 100만 출력 토큰당 $0.90로 최저 비용을 기록했으며, RAG workload에서는 각각 816 tok/s와 $2.29를 기록했습니다. 긴 입력 컨텍스트를 처리하는 RAG workload는 같은 모델에서도 처리량을 낮추고 토큰당 비용을 높였으며, G7의 비용은 G6e보다 두 workload 모두 약 1.4배 낮고 G6보다 채팅에서 약 4.9배, RAG에서 약 5.6배 낮았습니다.
08
벤치마크 수치는 특정 모델, serving stack, 토큰 분포, 동시성, 인스턴스와 AWS Region에 한정됩니다. 실제 배포에서는 애플리케이션의 요청 길이와 트래픽 패턴을 반영한 workload로 직접 측정하고, 처리량·지연 시간·토큰당 비용 중 어떤 목표를 우선할지 정해야 합니다. 사용이 끝난 엔드포인트, 엔드포인트 구성, 모델, AIPerf 작업과 ModelPackage를 삭제해야 지속적인 SageMaker AI 및 저장소 비용을 피할 수 있습니다.

용어 해설

Mixture-of-Experts
Mixture-of-Experts는 여러 Expert 네트워크 중 입력 토큰마다 일부만 활성화하는 모델 구조입니다. 전체 파라미터를 모두 계산하지 않고 선택된 Expert만 처리하므로 계산량을 줄일 수 있지만, 토큰 생성 단계에서는 Expert 가중치를 메모리에서 읽는 속도가 성능을 좌우합니다.
메모리 대역폭(Memory Bandwidth)
메모리 대역폭은 GPU가 메모리에서 데이터를 읽고 쓰는 속도를 뜻합니다. MoE 모델의 디코딩에서는 토큰마다 활성화된 Expert 가중치를 반복해서 읽어야 하므로 대역폭이 높을수록 토큰 사이 지연 시간이 줄고 초당 생성 토큰 수가 늘어납니다.
NVFP4
NVFP4는 NVIDIA Blackwell GPU 아키텍처와 함께 도입된 4비트 부동소수점 형식입니다. 가중치를 약 4비트로 표현해 모델 크기를 줄이며, Blackwell Tensor Core의 네이티브 FP4 연산을 사용하면 낮은 정밀도 가중치를 하드웨어 수준에서 가속할 수 있습니다.
첫 토큰 지연 시간(Time to First Token)
Time to First Token은 요청을 받은 뒤 첫 번째 출력 토큰이 생성될 때까지 걸리는 시간입니다. 스트리밍 애플리케이션에서는 사용자가 생성 결과를 보기 시작하는 시점을 결정하므로, 전체 요청 지연 시간과 별도로 대화형 응답성을 평가하는 핵심 지표로 활용됩니다.
검색 증강 생성(Retrieval Augmented Generation)
Retrieval Augmented Generation은 외부 문서나 검색 결과를 긴 입력 컨텍스트로 모델에 제공한 뒤 답변을 생성하는 방식입니다. 입력 토큰이 많아지면 모델이 생성 전에 더 많은 컨텍스트를 처리해야 하므로 출력 토큰 처리량이 낮아지고 생성 토큰당 비용이 높아질 수 있습니다.

기술

  • Amazon SageMaker AI
  • Amazon EC2 G5
  • Amazon EC2 G6
  • Amazon EC2 G6e
  • Amazon EC2 G7
  • NVIDIA Blackwell
  • NVIDIA AIPerf
  • DJL Large Model Inference
  • LMI 28.0
  • vLLM
  • ModelBuilder
  • Amazon S3
  • Amazon SageMaker Python SDK
  • AWS CLI

활용 사례

  • Qwen3-Coder-30B 기반 기업용 AI coding assistant
  • 코드 생성·디버깅·리팩터링·개발자 copilot
  • NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4 기반 기업용 AI assistant
  • 질의응답·요약·reasoning workload
  • RAG 및 long-context 애플리케이션
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 09.수집 2026. 09. 09.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.