TL;DR
ML 시스템 디자인 면접에서 다루는 핵심 흐름은 데이터 수집에서 시작해 특징 공학, 모델 학습, 서비스 설계, 평가, 운영까지의 파이프라인이다. 각 문제는 입력-처리-출력의 흐름을 가져가며, 오프라인과 온라인 평가 간의 균형, 그리고 시스템 차원의 트레이드오프를 고려한다. 이 글은 10개의 대표 시스템 설계 사례를 통해 후보 생성-랭킹-규칙 적용의 흐름과 실전 운영의 우선순위, 보안/신뢰성까지 포괄적으로 다룬다.
섹션별 상세
- 피드 랭킹 시스템은 후보 생성 → 랭킹 모델 → 규칙 레이어의 3단계 구성으로 동작한다. — Feed Ranking System의 How the System Works
- 광고 CTR 예측 시스템은 예측 CTR과 입찰 규칙을 결합해 최적의 광고를 선택한다. — Ads CTR Prediction System의 How the System Works
- 검색 시스템은 키워드 검색과 의미 기반 검색을 혼합하는 하이브리드 검색이 필요하다. — E-commerce Search Ranking System의 Model Choice 및 Mechanism
이미지 분석

본문의 머신러닝 시스템 설계에서 데이터 파이프라인과 모델 관리의 흐름을 한 눈에 파악하는 데 도움을 준다. 학습 파이프라인의 각 단계가 서로 연결되는 방식을 다이어그램으로 보여주어 독자의 이해도를 높인다.
ML Training Pipeline 다이어그램으로 데이터 수집-정제-특징공학-학습-평가-모델 레지스트리의 흐름을 시각화한다.

온라인 경로의 핵심인 실시간 추론 흐름을 명확히 보여주며, 사용자 요청에서부터 특징 조회, 모델 추론, 비즈니스 규칙 적용까지의 흐름을 요약한다.
Real-Time Inference 다이어그램으로 서비스 응답 흐름과 레이턴시 고려를 시각화한다.

온라인 행동 데이터를 수집하고 이를 다시 학습 데이터로 활용하는 loop를 시각화해, 모델이 어떻게 지속적으로 개선되는지 나타낸다.
Feedback Loop 다이어그램으로 지속적 학습의 피드백 흐름을 보여준다.

후보 생성-랭킹-규칙 레이어-최종 피드 구성의 흐름을 도식화해, 시스템 설계의 핵심 단계를 명확히 제시한다.
Recommendation Feed 다이어그램으로 추천 피드의 구성 요소를 한 눈에 보여준다.

광고 요청-타깃팅-입찰-수요예측-전시 결정의 흐름을 시각화해, CTR 예측 및 경매 기반 의사결정의 작동 원리를 보인다.
Ad Serving Pipeline 다이어그램으로 광고 케이스의 처리 흐름을 보여준다.

쿼리 이해-라인지식 검색-벡터 검색-후보 병합-랭크 모델의 흐름을 보여주고, 하이브리드 검색의 필요성을 시각화한다.
Product Search Ranking 다이어그램으로 검색 순위의 구성 요소를 설명한다.

트랜잭션 신호 추출-규칙 및 ML 점수링-최종 결정의 흐름과 보완 수단(그래프 특성 등)을 도식화한다.
Fraud Detection System 다이어그램으로 실시간 리스크 판정 흐름을 시각화한다.

경로 생성-라우팅 엔진-실시간 교통/날씨 등 보정 신호를 통해 최종 ETA를 산출하는 과정을 도식화한다.
ETA Prediction Pipeline 다이어그램으로 경로 생성-베이스 ETA-ML 보정의 흐름을 보여준다.

수신-헤더 파싱-발신자 확인-URL/첨부 파일 추출-리포트/규칙 적용-ML 분류의 흐름을 시각화한다.
Email Spam Filtering 다이어그램으로 이메일 분류 파이프라인을 보여준다.

카메라 이미지-품질 검사-전처리-비전 모델 추론-판정-출력의 흐름을 제시한다.
Visual Quality Inspection 다이어그램으로 QC 파이프라인의 흐름을 보여준다.

데이터 준비-특성공학-예측-계획 및 피드백의 순환을 도식화해, 비즈니스 지표와의 연결 고리를 보여준다.
Demand Forecasting Flowchart로 수요 예측 파이프라인을 요약한다.

수요/재고/경쟁가격 정보를 기반으로 가격을 추정하고, 가드레일 및 로그를 통해 정책을 적용하는 흐름을 도식화한다.
Dynamic Pricing System 다이어그램으로 가격 결정의 흐름을 보여준다.
용어 해설
- 정보검색 기반 생성(RAG)
- — Retrieval-Augmented Generation(RAG)은 외부 지식 저장소에서 관련 문서를 검색하고 이를 바탕으로 언어 모델의 응답을 보강하는 방식으로, 맥락 주입과 근거 제시를 강화한다.
- BM25
- — 전통적 정보검색에서 사용하는 단어 가중치 기반의 점수 매커니즘으로, 초기 후보 검색에서 중요한 역할을 한다.
- 벡터 검색(Vector Retrieval)
- — 텍스트를 벡터로 표현하고 코사인 유사도 등으로 의미 기반 매칭을 수행하는 검색 방식으로, 의미 기반 검색과 랭킹에 활용된다.
- 랭킹 학습(Learning-to-Rank)
- — 다양한 신호를 바탕으로 후보 아이템의 순위를 학습하는 랭크러너 기법으로, 검색/추천 시스템에서 품질을 높이는 핵심 방법론이다.
- 오프라인 경로(Offline Path)
- — 데이터 준비·모델 학습 등 배치 방식의 파이프라인 부분으로, 품질 보증과 재현성에 초점을 둔다.
- 온라인 경로(Online Path)
- — 서비스 시점에서 예측·전달을 담당하는 부분으로, 응답 속도와 안정성에 중점을 둔다.
기술
- BM25
- vector retrieval
- Learning-to-Rank
- gradient boosted trees
- Transformer
활용 사례
- Feed Ranking
- Ads CTR Prediction
- E-commerce Search Ranking
- Fraud Detection
- ETA Prediction
- Spam Detection
- Visual Defect Detection
- Demand Forecasting
- Dynamic Pricing
- RAG-Based Customer Support
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
