본문으로 건너뛰기
Databricks Blog조회 1

Zepto의 평가 중심 AI 에이전트 운영

Zepto가 MLflow 기반 평가 루프로 고객 지원 에이전트의 비용과 신뢰성을 함께 관리한 사례

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Zepto는 하루 10만 건이 넘는 고객 지원 티켓을 처리하는 multi-agent 시스템의 신뢰성을 높이기 위해 평가를 개발과 운영의 중심 인프라로 배치했습니다. MLflow trace, 골든 데이터셋, LLM-as-a-judge, 규칙 기반 평가자를 결합하고 개발 루프와 production loop 사이에 quality gate를 두어 기준선보다 나은 버전만 배포했습니다. 층화 샘플링은 하루 약 14,400개의 trace를 평가하면서 엣지 케이스의 45~60%를 포착했고, 균등 샘플링보다 이슈당 검토 비용을 86% 낮췄습니다. 그 결과 AI 에이전트가 티켓의 80% 이상을 처리하고 지원 비용을 65% 절감했으며, CSAT는 20%, 정확도는 8% 개선되고 투자 회수 기간은 한 달 미만으로 줄었습니다.

섹션별 상세

01
Zepto는 60개가 넘는 도시에 분 단위 배송을 제공하면서 하루 10만 건이 넘는 고객 지원 티켓을 multi-agent 시스템으로 처리했습니다. 트래픽이 날씨, Diwali, 여름철 수요와 사업 영역 확장에 따라 급변하자 단순히 에이전트를 빠르게 배포하는 방식으로는 내부 오류와 고객 피해를 조기에 포착하기 어려웠습니다. 의도 분류, 지식 검색, 입력 분석, 도구 호출, 응답 생성이 이어지는 다단계 흐름에서는 최종 답변이 그럴듯해도 중간 단계의 오류가 누적될 수 있어 시스템 전체를 평가하는 기반이 필요했습니다.
02
개발 루프와 production loop는 quality gate를 사이에 두고 연결됩니다. 개발 단계에서는 새 에이전트 버전, 골든 데이터셋, 현재 production baseline을 함께 평가하고 비용·품질·성능 기준을 모두 통과한 버전만 운영으로 보냅니다. 운영 단계에서 발견한 실패 trace는 다시 개발 데이터셋에 들어가 다음 버전의 회귀 평가를 강화하므로, 배포 후 문제가 고립되지 않고 개선 과정으로 환류됩니다.
개발 루프와 production loop가 배포 결정용 quality gate를 사이에 두고 연결된 구조도입니다.
Diagram왼쪽 개발 루프는 MLflow prompt optimization, MLflow 3.0 evaluation pipeline, golden dataset benchmarks를 거쳐 배포 여부를 판단합니다. 오른쪽 production loop는 샘플링된 실시간 trace, LLM-as-a-judge 평가, 자동 알림과 대시보드로 운영 상태를 감시하며, production failure가 재학습을 위한 feedback으로 개발 루프에 돌아갑니다. 본문의 평가 중심 아키텍처와 운영 실패의 자동 환류 구조를 시각적으로 보여줍니다.
03
모든 에이전트 호출은 프롬프트, completion, 검색 문서, tool call, latency, decision path를 포함한 trace를 생성합니다. MLflow의 자동 tracing과 사용자 정의 span을 함께 사용하고 OpenTelemetry span을 고유 ID로 연결한 뒤 Unity Catalog와 Delta 테이블에 기록해 실행 단계를 세밀하게 조회합니다. 이 구조 덕분에 서버 가동 여부만 보는 전통적 모니터링을 넘어 특정 판단이 어느 단계에서 잘못됐는지와 해당 오류가 비용·위험·고객 경험에 미친 영향을 함께 확인할 수 있습니다.
04
골든 데이터셋은 정상 사례뿐 아니라 경계·실패 사례, 이해관계자별 기대 결과, prompt injection과 identity attack 같은 보안 시나리오를 포함하는 기준선입니다. Zepto는 6개월 동안 데이터셋을 500개에서 2,000개, 다시 5,247개 사례로 늘렸고 개발·운영 정확도 차이를 8포인트에서 2포인트, 0.4포인트로 줄였습니다. 운영 실패를 데이터셋에 계속 추가하는 방식은 이후 버전의 회귀 검증 범위를 넓혀 production debugging 시간을 줄이는 10배의 효과를 만들었습니다.
05
Prompt optimization은 초기 prompt를 등록하고 같은 scorer로 여러 변형을 생성·평가한 뒤 A/B 결과가 가장 좋은 버전을 선택하는 흐름으로 자동화됐습니다. 강한 모델은 후보 탐색에 사용하고 production scoring에는 더 저렴한 모델을 사용해 최적화 과정의 비용을 통제했으며, model optionality로 proprietary와 open-source 모델 사이의 조합도 바꿀 수 있게 했습니다. 여기에 내장 평가자, 사용자 정의 평가자, latency와 tool call 수를 재는 코드 기반 평가자를 함께 배치해 인간 판단이 필요한 영역과 결정론적으로 계산할 수 있는 영역을 분리했습니다.
06
운영 트래픽은 균등하게 10%를 뽑는 대신 고가치 고객, 변경된 흐름, 부정적 감정, 높은 escalation 위험, 이미지·사기 가능성이 있는 상호작용에 따라 평가 비율을 달리했습니다. 전체 트래픽의 18~20%인 하루 약 14,400개 trace를 평가하면서 엣지 케이스의 45~60%를 포착하고 4~6분 안에 문제를 감지했으며, 균등 샘플링보다 이슈당 검토 비용을 86% 줄이고 엣지 케이스 탐지 효율을 9배 높였습니다. 5분마다 intent accuracy, groundedness, escalation risk, P95 latency를 점검하고 empathy, 비용, tool failure, CSAT, fraud detection도 추적해 AI 에이전트에 SRE와 유사한 운영 체계를 적용했습니다.
07
지원 시스템은 intent별 vertical agent와 여러 업무를 가로지르는 horizontal agent로 나뉩니다. WIMO, Missing, Expiry, Returns, Quality, Unable to Pay가 각각 주문 추적, 미배송, 상품 상태, 환불, 신선도, 결제 관련 흐름을 맡고, Image Deduplication과 Item Matching and Image Manipulation Detection이 이미지 재사용·상품 일치·조작 여부를 감시합니다. 이 분해 구조에서는 WIMO의 intent F1이나 Expiry의 OCR 정확도처럼 개별 기능을 따로 평가하는 동시에 fraud precision과 이미지 조작 탐지처럼 공통 통제 기능도 조합된 상태에서 측정할 수 있습니다.
배송 ETA를 반복하던 기존 응답이 정직한 배정 시간과 선제적 취소 제안으로 바뀐 고객 지원 화면 비교입니다.
Screenshot왼쪽 화면에서는 배송 상태가 바뀌지 않은 상황에서 에이전트가 같은 ETA를 반복해 고객의 재질문에도 동일한 답을 돌려줍니다. 오른쪽 화면에서는 라이더 배정 예상 시간과 지연 시 전액 환불이 가능한 취소 선택지를 함께 제시해 stale ETA 문제를 보완합니다. 본문에서 token-counter와 warning scorer가 이 반복을 5분 안에 감지하고 취소 on delay 기능으로 확장한 사례와 직접 연결됩니다.
08
운영 사례는 평가가 단순한 배포 전 검사보다 제품 개선 장치로 작동한다는 점을 보여줍니다. 캐시된 배송 정보 때문에 에이전트가 같은 ETA를 반복하던 문제는 token-counter와 warning scorer가 5분 안에 포착했고, 라이더가 10분 이상 정지하면 정직한 상태 업데이트와 전액 환불을 제안하는 규칙으로 바뀌었습니다. WIMO에 취소 기능을 추가했을 때 의도 정확도가 약 92.1%에서 87.4%로 떨어진 회귀도 고객 노출 전에 발견됐고, prompt 최적화와 데이터셋 보강 뒤 약 94.2%로 회복되어 rollback 없이 배포됐습니다.
09
Zepto는 단일 지표 최적화가 운영 품질을 보장하지 않는다는 점도 확인했습니다. 의도 정확도만 5포인트 높인 버전은 latency를 133% 늘리고 CSAT를 0.4포인트 낮췄지만, 복합 다목적 점수는 의도 정확도 3포인트 향상과 latency 17% 증가, CSAT 0.2포인트 상승을 함께 달성했습니다. 최종 성과로 AI 에이전트가 티켓의 80% 이상을 사람의 감독 아래 처리하고 지원 비용을 65% 낮췄으며, CSAT 20% 개선, 정확도 8% 개선, 개발 주기 3배 단축, 해결 시간 4배 단축, 한 달 미만의 투자 회수 기간을 기록했습니다.

용어 해설

LLM 평가자(LLM-as-a-judge)
LLM을 평가자로 활용해 에이전트의 답변 품질, 공감성, 근거 충실도처럼 단순 규칙만으로 판정하기 어려운 항목을 채점하는 방식입니다. 인간 평가 결과와의 일치도를 측정해 신뢰성을 보정하고, 고위험 판단에는 여러 평가자를 함께 사용합니다.
골든 데이터셋(Golden Dataset)
에이전트가 처리해야 할 정상·경계·실패 사례와 이해관계자별 기대 결과를 모아 둔 기준 데이터셋입니다. 새 버전의 회귀 평가와 운영 기준선 비교에 사용되며, 운영 실패 사례가 추가될수록 이후 버전의 신뢰성을 높이는 자산으로 축적됩니다.
층화 샘플링(Stratified Sampling)
모든 트래픽을 같은 비율로 뽑지 않고 고위험 고객, 신규 기능, 부정적 감정, 사기 가능성이 높은 이미지 상호작용 등에 더 높은 평가 비율을 적용하는 방식입니다. Zepto는 이 방식으로 제한된 비용 안에서 엣지 케이스 탐지 비율을 높였습니다.
OpenTelemetry
분산 시스템의 실행 흐름을 추적하기 위한 표준 관측 데이터 형식입니다. Zepto는 에이전트 호출에서 생성되는 프롬프트, 도구 호출, 지연 시간, 판단 경로를 고유 ID가 있는 span으로 기록해 여러 실행 단계의 trace를 연결했습니다.
Unity Catalog
데이터와 실행 기록을 중앙에서 관리하는 Databricks의 거버넌스 계층입니다. 이 사례에서는 MLflow trace와 평가 결과를 Delta 테이블에 모아 버전이 지정된 기준선, 감사 가능한 기록, 운영 대시보드의 기반으로 사용했습니다.

기술

  • Databricks
  • MLflow
  • MLflow Evaluation
  • MLflow prompt optimization
  • Unity Catalog
  • Delta tables
  • OpenTelemetry
  • LLM-as-a-judge
  • Cohen's Kappa
  • CI/CD
  • OpenTelemetry spans

활용 사례

  • 실시간 고객 지원 자동화
  • 주문 배송 ETA 및 취소 처리
  • 신선식품 이미지 품질 판정
  • 환불 사기 탐지
  • 이미지 중복·조작·상품 일치 검증
  • Multi-agent 시스템의 회귀 평가와 운영 모니터링
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 09.수집 2026. 09. 09.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.