TL;DR
넷플릭스 기술 블로그의 링크와 다이어그램은 소비자 애플리케이션의 요청을 Unified Serving System이 받아 라우팅과 전처리를 수행하고, 생성된 입력을 Model Scoring Service(MSS)에 'scoreModel' gRPC로 전달해 NVIDIA Triton 기반 추론을 수행하는 구조를 제시합니다. 전처리는 외부 데이터 소스에 fetchData gRPC로 조회해 피처를 생성하며, 일부 경로에서는 소비자가 REST로 직접 스코어링 서비스에 호출하는 옵션이 존재합니다. 이 설계는 전처리 재사용과 라우팅 정책 적용, 추론의 전용화로 대규모 LLM 서빙의 운영성과 일관성을 확보하려는 목적을 갖고 있습니다.
섹션별 상세
이미지 분석

넷플릭스의 서빙 다이어그램은 다수 소비자와 모델 배포를 지원하기 위해 중앙화된 서빙 계층을 두고 요청에 따라 데이터 페칭과 피처 생성을 선행한 뒤 전용 추론 엔진으로 위임하는 처리 파이프라인을 구성한 상황을 보여줍니다. 입력은 소비자 앱의 gRPC/REST 호출이고 내부에서는 라우팅 결정과 외부 데이터 소스 조회, 피처 생성이 순차적으로 이루어지며 출력은 MSS로 전달되는 모델 입력과 최종 예측 결과입니다. 다이어그램에 명시된 'serve model', 'fetchData', 'scoreModel' 호출 흐름이 아키텍처 증거로서 제시되므로 이 패턴은 대규모 서비스에서 라우팅·전처리 재사용·추론 분리의 실무적 이점을 목적으로 한다고 판단할 수 있습니다.
다이어그램은 소비자 애플리케이션(예: 페이지 구성 서비스 또는 대화형 추천 서비스)이 Unified Serving System에 'serve model' gRPC 또는 REST 호출을 보내면 라우팅→전처리→추론 위임→후처리의 흐름으로 처리되는 아키텍처를 그립니다. 전처리 단계는 외부 데이터 소스들에 fetchData gRPC 호출을 하여 피처를 생성하고, 추론은 Model Scoring Service로 'scoreModel' gRPC를 통해 전달됩니다. Model Scoring Service에는 NVIDIA TRITON INFERENCE SERVER 로고가 표시되어 Triton 기반 추론이 이 아키텍처의 중심임을 나타냅니다.
용어 해설
- 통합 서빙 시스템(Unified Serving System)
- — 소비자 애플리케이션의 'serve model' gRPC 호출을 받아 use case와 AB 할당에 따라 요청을 라우팅하고, 데이터 페칭과 피처 생성 같은 전처리 단계를 실행하여 최종적으로 추론을 MSS에 위임하는 중앙화된 서빙 계층입니다. 라우팅→전처리→추론 위임→후처리의 순서로 흐름을 관리하며, 일부 소비자는 REST로 직접 모델 스코어링 서비스에 요청할 수 있습니다. 이 구조는 서비스별 라우팅 정책과 전처리 재사용을 통해 일관된 서빙 경험을 제공하는 것을 목적으로 합니다.
- 모델 스코어링 서비스(Model Scoring Service (MSS))
- — 추론 작업을 수행하는 전용 서비스로, Unified Serving System이 전처리 결과를 전달하면 'scoreModel' gRPC 호출로 모델 추론을 수행합니다. 이미지의 구성에서는 NVIDIA Triton 기반의 추론 엔진을 MSS로 사용하여 고성능 모델 서빙을 맡기고 있습니다. MSS는 중앙화된 추론 엔진으로 모델 배포와 확장, 지연 관리 측면에서 핵심 역할을 합니다.
- 전처리(데이터 페칭·피처 생성)(Pre-processing (data fetching, feature generation))
- — Unified Serving System 내부에서 데이터 소스들에 fetchData gRPC 호출을 보내 필요한 원천 데이터를 취합하고 이를 기반으로 피처를 생성하는 단계입니다. 이 과정은 입력을 모델 친화적 형태로 변환하여 MSS로 전달할 예측 입력을 구성하는 역할을 하며, 데이터 소스 A·B 등 외부 저장소와의 연동이 포함됩니다. 전처리의 중앙화는 중복 계산을 줄이고 모델 입력 일관성을 확보하는 데 기여합니다.
- 사용 사례·AB 할당 기반 라우팅(Routing based on use case and AB allocation)
- — 소비자 애플리케이션의 요청을 받아 서비스 목적과 A/B 실험 할당에 따라 처리 경로를 결정하는 로직입니다. 라우팅 단계에서는 어떤 전처리 파이프라인을 거칠지와 어느 MSS 인스턴스로 추론을 위임할지를 선택하며, 실험군 분배 정보를 반영해 트래픽을 특정 모델 버전이나 경로로 유도할 수 있습니다. 이를 통해 실험 제어와 운영상 분리된 흐름 유지가 가능합니다.
언급된 도구
모델 스코어링과 추론을 고성능으로 처리하는 인퍼런스 서버 역할을 수행합니다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.