본문으로 건너뛰기
AI Engineer조회 1

DoorDash의 교차 기능 팀을 위한 AI 평가 플랫폼 구축 사례

DoorDash가 API 우선 설계와 교차 기능 협업을 통해 구축한 AI 모델 평가 플랫폼의 아키텍처와 운영 성과를 소개한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

DoorDash의 GenAI 플랫폼 팀이 AI 모델 평가를 엔지니어링 도구를 넘어 전사적 협업 체계로 구축한 사례를 다룬다. API 우선 원칙을 통해 비엔지니어 운영진이 직접 코딩 에이전트를 활용해 필요한 어노테이션 UI를 구축하도록 지원하며 개발 병목을 해소했다. 데이터 추적, 샘플링, 인간 어노테이션, 판정 모델 보정으로 이어지는 8단계 루프를 자동화하여 평가의 신뢰도를 높인 것이 핵심이다. 이를 통해 어노테이션 비용을 40% 절감하고 제품 품질 개선 속도를 획기적으로 끌어올리는 성과를 거두었다.

챕터별 상세

00:00

DoorDash GenAI 플랫폼의 역할과 세 가지 핵심 요소

DoorDash의 GenAI 플랫폼은 정확도, 지연 시간, 비용이라는 세 가지 상충하는 가치 사이에서 최적의 균형점을 찾는 것을 목표로 한다. LLM 게이트웨이와 에이전트 게이트웨이를 통해 주당 6억 건 이상의 API 호출을 처리하며 전사의 모든 AI 제품을 뒷받침하는 인프라를 제공한다. 초기에는 모델 선택과 호스팅에 집중했으나 서비스 규모가 커짐에 따라 에이전트의 성능을 검증하는 평가 시스템이 네 번째 핵심 기둥으로 부상했다. 플랫폼은 개별 제품 팀이 복잡한 인프라 고민 없이 비즈니스 로직에만 집중할 수 있도록 표준화된 도구를 지원한다.
03:05

UI에서 API, 그리고 워크플로우 중심으로의 진화

플랫폼의 발전 단계는 비엔지니어를 위한 UI 제공에서 시작하여 엔지니어의 자율성을 높이는 API 우선 설계로 확장됐다. 최근에는 코딩 에이전트를 활용해 운영팀이 직접 워크플로우를 구축하는 단계에 진입했다. 플랫폼 팀이 모든 팀의 요구사항에 맞는 UI를 직접 제작하는 방식은 병목 현상을 초래했기 때문에 안정적인 API를 제공하고 사용자가 직접 도구를 만들게 하는 전략을 택했다. 이러한 변화는 엔지니어링 리소스를 절약하면서도 현업의 요구에 유연하게 대응할 수 있는 구조를 만들었다.
04:01

교차 기능적 팀 스포츠로서의 AI 평가 체계

AI 평가는 단순한 엔지니어링 도구가 아니라 전략, 제품, 운영, 엔지니어링 팀이 협업하는 전사적 품질 인프라이다. 전략팀이 품질 기준을 설정하면 제품 관리자는 이를 구체적인 평가 루브릭으로 변환하고 운영팀은 실제 데이터에 어노테이션을 수행한다. 엔지니어링 팀은 텔레메트리와 데이터셋, 자동화된 판정 모델(Judge)을 공급하여 전체 프로세스가 원활하게 돌아가도록 지원한다. 품질은 특정 팀의 전유물이 아니라 각 팀이 전문 지식을 투입하여 운영 루프를 완성할 때 비로소 확보된다.
05:53

데이터 추적부터 판정 모델 보정까지의 연속 루프

평가 프로세스는 추적(Trace), 샘플링, 어노테이션, 골든 세트 생성, 보정(Calibrate), 모니터링으로 이어지는 8단계의 연속적인 루프로 구성된다. 수많은 운영 데이터 중 인간이 검토할 가치가 있는 세션을 선별하여 어노테이션을 수행하고 이를 기반으로 신뢰할 수 있는 골든 세트를 구축한다. GEPA 라이브러리를 활용해 자동화된 판정 모델의 프롬프트를 최적화하며 인간의 판단 결과와 모델의 일치도를 높이는 과정을 반복한다. 이 루프를 통해 모델의 성능 저하를 실시간으로 감지하고 지속적으로 품질을 개선할 수 있는 기반을 마련했다.

GEPA는 프롬프트 최적화를 돕는 라이브러리로, 여기서는 판정 모델의 정확도를 높이는 데 사용됐다.

09:32

운영팀이 직접 구축하는 맞춤형 어노테이션 도구

API 우선 전략 덕분에 운영팀은 엔지니어의 도움 없이도 코딩 에이전트를 사용해 자신들에게 필요한 어노테이션 UI를 직접 구축한다. 메뉴 데이터 검증이나 이미지 레이블링 등 각 팀의 특수한 요구사항에 맞는 인터페이스를 '바이브 코딩(Vibe Coding)' 방식으로 빠르게 생성한다. 플랫폼 팀은 모든 UI를 직접 만드는 대신 안정적인 API와 텔레메트리 레이어를 제공하는 데 집중하여 개발 병목을 해소했다. 결과적으로 엔지니어링 리소스를 절약하면서도 현업의 도메인 지식을 평가 프로세스에 즉각 반영할 수 있게 됐다.

바이브 코딩(Vibe Coding)은 정교한 설계보다는 코딩 에이전트와의 상호작용을 통해 직관적으로 코드를 생성하는 방식을 의미한다.

11:21

셀프 서비스 기반의 판정 모델 프롬프트 최적화

판정 모델(LLM Judge)의 프롬프트 보정 과정은 제품 관리자나 운영자가 직접 수행할 수 있는 셀프 서비스 UI로 제공된다. 사용자가 기준이 되는 골든 세트와 모델을 선택하면 시스템이 자동으로 프롬프트를 최적화하고 이전 버전과의 일치도 변화를 시각화하여 보여준다. 최적화 전후의 프롬프트를 나란히 비교할 수 있어 비전문가도 모델의 판단 논리가 어떻게 개선되었는지 쉽게 이해하고 신뢰할 수 있다. 프롬프트의 소유권은 팀의 성격에 따라 전략팀, 제품팀, 엔지니어링팀 중 가장 적합한 곳이 유연하게 가져간다.
14:04

플랫폼 도입에 따른 비용 절감과 운영 효율화

평가 플랫폼 도입 이후 어노테이션 작업당 비용이 기존 스프레드시트 기반 방식 대비 40% 감소하는 성과를 거두었다. 수작업으로 진행되던 데이터 전달 과정이 자동화된 워크플로우로 대체되면서 아이디어에서 실제 평가 데이터 확보까지 걸리는 시간이 획기적으로 단축됐다. 재사용 가능한 인프라 컴포넌트가 축적됨에 따라 장기적인 운영 비용 절감 효과가 복리로 발생하고 있다. 전사적인 품질 루프가 정착되면서 DoorDash는 더 빠르고 안정적으로 고품질의 AI 제품을 시장에 출시할 수 있게 됐다.

용어 해설

평가(Evals)
AI 모델이나 에이전트의 출력이 의도한 품질 기준을 충족하는지 측정하는 프로세스이다. 정확도, 안전성, 지연 시간 등 다양한 지표를 수치화하여 모델의 성능을 객관적으로 판단하고 개선 방향을 결정하는 근거가 된다.
골든 세트(Golden Set)
인간 전문가가 직접 검수하여 정답(Ground Truth)으로 확정한 고품질 데이터셋이다. 자동화된 판정 모델(Judge)의 정확도를 측정하거나 보정할 때 기준점으로 사용되며 평가 시스템의 신뢰도를 담보하는 핵심 자산이다.
텔레메트리(Telemetry)
시스템 운영 중에 발생하는 로그, 추적(Trace), 점수 등의 데이터를 원격으로 수집하고 전송하는 체계이다. AI 서비스에서는 모델의 입출력 흐름을 실시간으로 파악하여 성능 저하나 오류를 감지하는 데 필수적이다.
어노테이션(Annotation)
데이터에 레이블이나 주석을 달아 AI가 학습하거나 평가할 수 있는 형태로 만드는 작업이다. DoorDash 사례에서는 운영팀이 직접 모델의 답변 품질을 좋음/나쁨 등으로 분류하여 평가 루프의 기초 데이터를 생성한다.
보정(Calibration)
자동화된 판정 모델(LLM Judge)의 판단 결과가 인간 전문가의 판단과 일치하도록 조정하는 과정이다. 프롬프트를 최적화하여 모델이 인간과 유사한 논리로 품질을 평가하게 함으로써 평가 자동화의 신뢰성을 높인다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 29.수집 2026. 08. 29.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.