본문으로 건너뛰기
r/LLMDevs조회 1

넷플릭스의 사내 LLM 서빙 아키텍처

통합 서빙 시스템이 전처리·라우팅을 담당하고 Triton 기반 MSS로 추론을 위임한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

넷플릭스 기술 블로그의 링크와 다이어그램은 소비자 애플리케이션의 요청을 Unified Serving System이 받아 라우팅과 전처리를 수행하고, 생성된 입력을 Model Scoring Service(MSS)에 'scoreModel' gRPC로 전달해 NVIDIA Triton 기반 추론을 수행하는 구조를 제시합니다. 전처리는 외부 데이터 소스에 fetchData gRPC로 조회해 피처를 생성하며, 일부 경로에서는 소비자가 REST로 직접 스코어링 서비스에 호출하는 옵션이 존재합니다. 이 설계는 전처리 재사용과 라우팅 정책 적용, 추론의 전용화로 대규모 LLM 서빙의 운영성과 일관성을 확보하려는 목적을 갖고 있습니다.

섹션별 상세

Unified Serving System의 역할과 동작 흐름이 핵심 쟁점입니다. 이 시스템은 소비자 애플리케이션으로부터 'serve model' gRPC 호출을 수신하고 use case와 A/B 할당에 따라 라우팅을 수행한 뒤, fetchData gRPC로 외부 데이터 소스를 조회하고 전처리를 통해 모델 입력을 생성합니다. 그런 다음 추론은 MSS로 위임되고 결과에 후처리를 거쳐 응답을 반환하므로 전처리 재사용과 라우팅 정책 적용이 가능한 중앙화된 파이프라인이라는 점이 논의 대상이 됩니다.
전처리와 데이터 페칭의 위치에 따른 트레이드오프가 자주 거론될 가능성이 높습니다. 다이어그램에서는 Unified Serving System 내부에서 데이터 소스 A·B로 fetchData gRPC 호출을 보내 전처리를 수행하는 구조를 채택해 네트워크 왕복과 레이턴시, 캐시 전략의 영향이 직접적으로 나타납니다. 따라서 전처리를 서빙 계층에 두는 설계가 비용과 지연에 어떤 영향을 미치는지, 또는 전처리를 MSS 쪽에 두어 추론 지연을 줄일지에 대한 기술적 논쟁이 예상됩니다.
MSS로서 NVIDIA Triton을 사용하는 선택과 그에 따른 운영·성능 이슈가 또 다른 핵심 논점입니다. 다이어그램은 Model Scoring Service에 NVIDIA TRITON INFERENCE SERVER를 배치하고 'scoreModel' gRPC로 추론을 호출하는 흐름을 보여주어 Triton 기반 배포, 컨테이너화, 스케일링·GPU 할당 정책 같은 운영적 고려사항이 중요해집니다. 이와 함께 소비자 애플리케이션이 REST HTTP로 직접 Triton에 호출할 수 있는 경로를 둔 설계가 유연성 대 일관성 측면에서 어떤 장단점을 갖는지도 토론거리입니다.

이미지 분석

다이어그램은 소비자 애플리케이션(예: 페이지 구성 서비스 또는 대화형 추천 서비스)이 Unified Serving System에 'serve model' gRPC 또는 REST 호출을 보내면 라우팅→전처리→추론 위임→후처리의 흐름으로 처리되는 아키텍처를 그립니다. 전처리 단계는 외부 데이터 소스들에 fetchData gRPC 호출을 하여 피처를 생성하고, 추론은 Model Scoring Service로 'scoreModel' gRPC를 통해 전달됩니다. Model Scoring Service에는 NVIDIA TRITON INFERENCE SERVER 로고가 표시되어 Triton 기반 추론이 이 아키텍처의 중심임을 나타냅니다.
Diagram

넷플릭스의 서빙 다이어그램은 다수 소비자와 모델 배포를 지원하기 위해 중앙화된 서빙 계층을 두고 요청에 따라 데이터 페칭과 피처 생성을 선행한 뒤 전용 추론 엔진으로 위임하는 처리 파이프라인을 구성한 상황을 보여줍니다. 입력은 소비자 앱의 gRPC/REST 호출이고 내부에서는 라우팅 결정과 외부 데이터 소스 조회, 피처 생성이 순차적으로 이루어지며 출력은 MSS로 전달되는 모델 입력과 최종 예측 결과입니다. 다이어그램에 명시된 'serve model', 'fetchData', 'scoreModel' 호출 흐름이 아키텍처 증거로서 제시되므로 이 패턴은 대규모 서비스에서 라우팅·전처리 재사용·추론 분리의 실무적 이점을 목적으로 한다고 판단할 수 있습니다.

다이어그램은 소비자 애플리케이션(예: 페이지 구성 서비스 또는 대화형 추천 서비스)이 Unified Serving System에 'serve model' gRPC 또는 REST 호출을 보내면 라우팅→전처리→추론 위임→후처리의 흐름으로 처리되는 아키텍처를 그립니다. 전처리 단계는 외부 데이터 소스들에 fetchData gRPC 호출을 하여 피처를 생성하고, 추론은 Model Scoring Service로 'scoreModel' gRPC를 통해 전달됩니다. Model Scoring Service에는 NVIDIA TRITON INFERENCE SERVER 로고가 표시되어 Triton 기반 추론이 이 아키텍처의 중심임을 나타냅니다.

용어 해설

통합 서빙 시스템(Unified Serving System)
소비자 애플리케이션의 'serve model' gRPC 호출을 받아 use case와 AB 할당에 따라 요청을 라우팅하고, 데이터 페칭과 피처 생성 같은 전처리 단계를 실행하여 최종적으로 추론을 MSS에 위임하는 중앙화된 서빙 계층입니다. 라우팅→전처리→추론 위임→후처리의 순서로 흐름을 관리하며, 일부 소비자는 REST로 직접 모델 스코어링 서비스에 요청할 수 있습니다. 이 구조는 서비스별 라우팅 정책과 전처리 재사용을 통해 일관된 서빙 경험을 제공하는 것을 목적으로 합니다.
모델 스코어링 서비스(Model Scoring Service (MSS))
추론 작업을 수행하는 전용 서비스로, Unified Serving System이 전처리 결과를 전달하면 'scoreModel' gRPC 호출로 모델 추론을 수행합니다. 이미지의 구성에서는 NVIDIA Triton 기반의 추론 엔진을 MSS로 사용하여 고성능 모델 서빙을 맡기고 있습니다. MSS는 중앙화된 추론 엔진으로 모델 배포와 확장, 지연 관리 측면에서 핵심 역할을 합니다.
전처리(데이터 페칭·피처 생성)(Pre-processing (data fetching, feature generation))
Unified Serving System 내부에서 데이터 소스들에 fetchData gRPC 호출을 보내 필요한 원천 데이터를 취합하고 이를 기반으로 피처를 생성하는 단계입니다. 이 과정은 입력을 모델 친화적 형태로 변환하여 MSS로 전달할 예측 입력을 구성하는 역할을 하며, 데이터 소스 A·B 등 외부 저장소와의 연동이 포함됩니다. 전처리의 중앙화는 중복 계산을 줄이고 모델 입력 일관성을 확보하는 데 기여합니다.
사용 사례·AB 할당 기반 라우팅(Routing based on use case and AB allocation)
소비자 애플리케이션의 요청을 받아 서비스 목적과 A/B 실험 할당에 따라 처리 경로를 결정하는 로직입니다. 라우팅 단계에서는 어떤 전처리 파이프라인을 거칠지와 어느 MSS 인스턴스로 추론을 위임할지를 선택하며, 실험군 분배 정보를 반영해 트래픽을 특정 모델 버전이나 경로로 유도할 수 있습니다. 이를 통해 실험 제어와 운영상 분리된 흐름 유지가 가능합니다.

언급된 도구

NVIDIA Triton Inference Server중립

모델 스코어링과 추론을 고성능으로 처리하는 인퍼런스 서버 역할을 수행합니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 31.수집 2026. 07. 31.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.