TL;DR
Zepto는 하루 10만 건이 넘는 고객 지원 티켓을 처리하는 multi-agent 시스템의 신뢰성을 높이기 위해 평가를 개발과 운영의 중심 인프라로 배치했습니다. MLflow trace, 골든 데이터셋, LLM-as-a-judge, 규칙 기반 평가자를 결합하고 개발 루프와 production loop 사이에 quality gate를 두어 기준선보다 나은 버전만 배포했습니다. 층화 샘플링은 하루 약 14,400개의 trace를 평가하면서 엣지 케이스의 45~60%를 포착했고, 균등 샘플링보다 이슈당 검토 비용을 86% 낮췄습니다. 그 결과 AI 에이전트가 티켓의 80% 이상을 처리하고 지원 비용을 65% 절감했으며, CSAT는 20%, 정확도는 8% 개선되고 투자 회수 기간은 한 달 미만으로 줄었습니다.
섹션별 상세


용어 해설
- LLM 평가자(LLM-as-a-judge)
- — LLM을 평가자로 활용해 에이전트의 답변 품질, 공감성, 근거 충실도처럼 단순 규칙만으로 판정하기 어려운 항목을 채점하는 방식입니다. 인간 평가 결과와의 일치도를 측정해 신뢰성을 보정하고, 고위험 판단에는 여러 평가자를 함께 사용합니다.
- 골든 데이터셋(Golden Dataset)
- — 에이전트가 처리해야 할 정상·경계·실패 사례와 이해관계자별 기대 결과를 모아 둔 기준 데이터셋입니다. 새 버전의 회귀 평가와 운영 기준선 비교에 사용되며, 운영 실패 사례가 추가될수록 이후 버전의 신뢰성을 높이는 자산으로 축적됩니다.
- 층화 샘플링(Stratified Sampling)
- — 모든 트래픽을 같은 비율로 뽑지 않고 고위험 고객, 신규 기능, 부정적 감정, 사기 가능성이 높은 이미지 상호작용 등에 더 높은 평가 비율을 적용하는 방식입니다. Zepto는 이 방식으로 제한된 비용 안에서 엣지 케이스 탐지 비율을 높였습니다.
- OpenTelemetry
- — 분산 시스템의 실행 흐름을 추적하기 위한 표준 관측 데이터 형식입니다. Zepto는 에이전트 호출에서 생성되는 프롬프트, 도구 호출, 지연 시간, 판단 경로를 고유 ID가 있는 span으로 기록해 여러 실행 단계의 trace를 연결했습니다.
- Unity Catalog
- — 데이터와 실행 기록을 중앙에서 관리하는 Databricks의 거버넌스 계층입니다. 이 사례에서는 MLflow trace와 평가 결과를 Delta 테이블에 모아 버전이 지정된 기준선, 감사 가능한 기록, 운영 대시보드의 기반으로 사용했습니다.
기술
- Databricks
- MLflow
- MLflow Evaluation
- MLflow prompt optimization
- Unity Catalog
- Delta tables
- OpenTelemetry
- LLM-as-a-judge
- Cohen's Kappa
- CI/CD
- OpenTelemetry spans
활용 사례
- 실시간 고객 지원 자동화
- 주문 배송 ETA 및 취소 처리
- 신선식품 이미지 품질 판정
- 환불 사기 탐지
- 이미지 중복·조작·상품 일치 검증
- Multi-agent 시스템의 회귀 평가와 운영 모니터링
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


