TL;DR
DoorDash의 GenAI 플랫폼 팀이 AI 모델 평가를 엔지니어링 도구를 넘어 전사적 협업 체계로 구축한 사례를 다룬다. API 우선 원칙을 통해 비엔지니어 운영진이 직접 코딩 에이전트를 활용해 필요한 어노테이션 UI를 구축하도록 지원하며 개발 병목을 해소했다. 데이터 추적, 샘플링, 인간 어노테이션, 판정 모델 보정으로 이어지는 8단계 루프를 자동화하여 평가의 신뢰도를 높인 것이 핵심이다. 이를 통해 어노테이션 비용을 40% 절감하고 제품 품질 개선 속도를 획기적으로 끌어올리는 성과를 거두었다.
챕터별 상세
DoorDash GenAI 플랫폼의 역할과 세 가지 핵심 요소
UI에서 API, 그리고 워크플로우 중심으로의 진화
교차 기능적 팀 스포츠로서의 AI 평가 체계
데이터 추적부터 판정 모델 보정까지의 연속 루프
GEPA는 프롬프트 최적화를 돕는 라이브러리로, 여기서는 판정 모델의 정확도를 높이는 데 사용됐다.
운영팀이 직접 구축하는 맞춤형 어노테이션 도구
바이브 코딩(Vibe Coding)은 정교한 설계보다는 코딩 에이전트와의 상호작용을 통해 직관적으로 코드를 생성하는 방식을 의미한다.
셀프 서비스 기반의 판정 모델 프롬프트 최적화
플랫폼 도입에 따른 비용 절감과 운영 효율화
용어 해설
- 평가(Evals)
- — AI 모델이나 에이전트의 출력이 의도한 품질 기준을 충족하는지 측정하는 프로세스이다. 정확도, 안전성, 지연 시간 등 다양한 지표를 수치화하여 모델의 성능을 객관적으로 판단하고 개선 방향을 결정하는 근거가 된다.
- 골든 세트(Golden Set)
- — 인간 전문가가 직접 검수하여 정답(Ground Truth)으로 확정한 고품질 데이터셋이다. 자동화된 판정 모델(Judge)의 정확도를 측정하거나 보정할 때 기준점으로 사용되며 평가 시스템의 신뢰도를 담보하는 핵심 자산이다.
- 텔레메트리(Telemetry)
- — 시스템 운영 중에 발생하는 로그, 추적(Trace), 점수 등의 데이터를 원격으로 수집하고 전송하는 체계이다. AI 서비스에서는 모델의 입출력 흐름을 실시간으로 파악하여 성능 저하나 오류를 감지하는 데 필수적이다.
- 어노테이션(Annotation)
- — 데이터에 레이블이나 주석을 달아 AI가 학습하거나 평가할 수 있는 형태로 만드는 작업이다. DoorDash 사례에서는 운영팀이 직접 모델의 답변 품질을 좋음/나쁨 등으로 분류하여 평가 루프의 기초 데이터를 생성한다.
- 보정(Calibration)
- — 자동화된 판정 모델(LLM Judge)의 판단 결과가 인간 전문가의 판단과 일치하도록 조정하는 과정이다. 프롬프트를 최적화하여 모델이 인간과 유사한 논리로 품질을 평가하게 함으로써 평가 자동화의 신뢰성을 높인다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



