본문으로 건너뛰기
AWS ML Blog조회 1

Amazon SageMaker AI 2025 연말 결산 2부: 관측성 개선 및 모델 커스터마이징·호스팅 기능 강화

Amazon SageMaker AI는 2025년 정밀한 지표 모니터링, 서버리스 기반의 모델 미세 조정, 실시간 음성 AI를 위한 양방향 스트리밍 기능을 도입하여 생성형 AI 운영 효율성을 대폭 강화했다.

섹션별 상세

01
인스턴스 및 컨테이너 수준의 정밀한 관측성 강화: SageMaker AI는 기존 엔드포인트 단위의 집계 데이터에서 벗어나 인스턴스 및 컨테이너별 CPU, 메모리, GPU 사용량과 호출 성능(지연 시간, 오류, 처리량)을 추적하는 'Enhanced Metrics'를 도입했다. MetricsConfig 파라미터를 통해 10초에서 300초 사이의 게시 빈도를 설정할 수 있으며, 이를 통해 트래픽 불균형이나 특정 리소스의 병목 현상을 실시간으로 진단하고 자동 스케일링 정책과 연동할 수 있다.
python
response = sagemaker_client.create_endpoint_config(
    EndpointConfigName='my-config',
    ProductionVariants=[{...}],
    MetricsConfig={
        'EnableEnhancedMetrics': True,
        'MetricPublishFrequencyInSeconds': 60 # 지원 범위: 10, 30, 60, 120, 180, 240, 300
    }
)

SageMaker 엔드포인트에서 인스턴스 및 컨테이너 단위의 정밀 지표를 활성화하는 설정 예시

02
추론 컴포넌트를 위한 안전한 롤링 업데이트: 대규모 언어 모델(LLM) 배포 시 발생하는 리소스 제약을 해결하기 위해 인프라를 이중으로 구성할 필요가 없는 롤링 업데이트 방식을 도입했다. 새로운 모델 버전을 설정된 배치 단위로 순차 배포하며, Amazon CloudWatch 알람과 통합되어 이상 감지 시 자동으로 롤백을 수행함으로써 무중단 배포와 안정성을 동시에 확보한다.
03
인프라 관리 없는 서버리스 모델 커스터마이징: 모델과 데이터 크기에 따라 최적의 컴퓨팅 자원을 자동으로 할당하는 서버리스 튜닝 기능을 통해 인프라 관리 부담을 제거했다. Amazon Nova, DeepSeek, Llama 등 주요 모델을 지원하며, Supervised Fine-tuning(SFT)뿐만 아니라 RLVR, RLAIF와 같은 고급 강화학습 기법을 UI 또는 코드로 손쉽게 적용할 수 있고 MLflow를 통한 실험 추적도 기본 제공한다.
SageMaker Studio의 모델 관리 및 커스터마이징 UI 화면
ScreenshotAmazon Nova, Llama 3.1, Qwen 등 다양한 기본 모델을 선택하고 UI를 통해 직접 미세 조정을 시작할 수 있는 통합 인터페이스를 보여준다. 'Customize model' 드롭다운 메뉴를 통해 UI 기반, AI 에이전트 기반, 코드 기반의 세 가지 커스터마이징 방식을 선택할 수 있음을 확인할 수 있다.
04
실시간 음성 AI를 위한 양방향 스트리밍 지원: 단일 영구 연결을 통해 데이터가 양방향으로 동시 흐르는 'Bidirectional Streaming' 기능을 도입하여 실시간 음성 에이전트 및 라이브 번역 서비스 구현을 가능하게 했다. HTTP/2 및 WebSocket 프로토콜을 활용하여 클라이언트와 모델 컨테이너 간의 지연 시간을 최소화하며, Deepgram의 Nova-3 모델과 같은 파트너 솔루션을 AWS Marketplace를 통해 즉시 배포할 수 있는 환경을 구축했다.
text
com.amazonaws.sagemaker.capabilities.bidirectional-streaming=true

사용자 지정 컨테이너에서 양방향 스트리밍 기능을 활성화하기 위해 설정해야 하는 Docker 레이블

05
엔터프라이즈 보안 및 네트워크 확장성 개선: 모든 리전에서 AWS PrivateLink 지원을 확대하여 공용 인터넷을 거치지 않고 VPC 내에서 안전하게 엔드포인트에 접근할 수 있도록 했으며, IPv6 및 듀얼 스택 지원을 통해 현대적인 네트워크 아키텍처 요구사항을 충족했다. 이는 엄격한 데이터 규정을 준수해야 하는 금융 및 공공 기관의 AI 도입 장벽을 낮추는 데 기여한다.

용어 해설

검증 가능한 보상 기반 강화학습(RLVR)
수학 문제 풀이나 코드 생성처럼 정답이 명확한 작업에서 모델의 출력을 자동 검증하여 보상을 주는 강화학습 기법이다. 사람이 일일이 피드백을 주지 않아도 모델이 스스로 성능을 개선할 수 있어 학습 효율이 높다.
양방향 스트리밍(Bidirectional Streaming)
단일 연결을 통해 클라이언트와 서버가 동시에 데이터를 주고받는 통신 방식이다. 기존의 요청-응답 구조와 달리 모델이 답변을 생성하는 동안에도 사용자가 추가 입력을 보낼 수 있어 실시간 음성 대화 시스템에 필수적이다.
롤링 업데이트(Rolling Update)
서비스 중단 없이 새로운 버전의 모델을 점진적으로 배포하는 방식이다. 전체 인프라를 한꺼번에 교체하지 않고 일부 인스턴스씩 순차적으로 업데이트하며, 문제 발생 시 즉시 이전 버전으로 되돌릴 수 있어 안정성이 높다.
AWS 프라이빗링크(AWS PrivateLink)
공용 인터넷을 거치지 않고 AWS 네트워크 내부에서만 서비스 간 통신이 가능하게 하는 기술이다. 데이터 유출 위험을 차단하고 보안 규정을 준수하면서 AI 모델 엔드포인트에 안전하게 접근할 수 있도록 돕는다.

기술

  • Amazon SageMaker AI
  • Amazon Nova
  • DeepSeek
  • Llama
  • MLflow
  • AWS PrivateLink
  • WebSocket
  • HTTP/2

활용 사례

  • 실시간 음성 에이전트
  • 도메인 특화 LLM 미세 조정
  • 대규모 모델 무중단 배포
  • 정밀 리소스 모니터링
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 21.수집 2026. 02. 21.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.