챕터별 상세
00:00
Lyft AI Assist 개요
Lyft는 고객 지원을 위해 7개 이상의 AI 에이전트를 프로덕션 환경에서 운영하고 있다. 매달 7,900만 건의 운행 중 27만 건 이상의 상호작용을 AI가 처리한다. AI 에이전트의 목표는 단순한 응답 차단이 아니라 고객 문제를 완전히 해결하는 것이다. 현재 65% 이상의 문제 해결률과 35% 이상의 AI 해결률을 기록하고 있다.
03:35
평가의 중요성과 품질 게이트
프로덕션 환경에서 AI 에이전트를 배포할 때 평가는 품질을 보장하는 게이트 역할을 한다. 기존의 결정론적 로직에서 LLM 기반 에이전트로 전환하면서 평가 체계의 변화가 필요했다. 오프라인 평가는 배포 전 모델의 성능을 검증하여 프로덕션 사고를 방지하는 핵심 수단이다.
06:03
경량화된 오프라인 시뮬레이터
오프라인 평가를 위해 경량화된 시뮬레이터를 구축했다. LangGraph 에이전트를 기반으로 하며, LLM을 활용해 사용자 역할을 시뮬레이션한다. 실제 네트워크 호출 대신 MCP 출력을 모킹(mocking)하여 다양한 시나리오를 테스트한다. 이를 통해 에이전트의 복잡한 워크플로를 프로덕션 환경과 유사하게 검증할 수 있다.
08:17
LLM-as-a-judge와 스칼라 메트릭의 한계
기존의 스칼라 메트릭(예: 도움됨 점수 0~1)은 구체적인 개선 방향을 제시하지 못한다. 0.4점과 0.7점의 차이가 무엇인지, 어떻게 개선해야 하는지 알기 어렵다. 따라서 태스크별 성공과 실패 기준을 명확히 정의한 루브릭 기반의 평가가 필요하다.
09:52
태스크 기반 루브릭과 실패 모드
에이전트가 수행해야 할 태스크별로 성공/실패 기준을 루브릭으로 정의했다. 예를 들어 교육 루브릭은 에이전트가 고객에게 적절한 정보를 제공했는지, 상담원 연결이 필요한 상황인지 판단한다. 실패 모드를 구체화하면 엔지니어링 팀이 프롬프트나 툴 호출 로직을 수정할 수 있는 실행 가능한 인사이트를 얻을 수 있다.
11:28
LLM 평가자의 신뢰도 확보
LLM 평가자(LLM-as-a-judge)를 신뢰하기 위해 인간 피드백 루프를 도입했다. 인간 전문가가 평가한 데이터와 LLM의 평가 결과를 비교하여 일치율을 높인다. 일치율이 낮으면 프롬프트나 평가 기준을 수정하여 LLM 평가자를 지속적으로 정렬한다.
14:14
LangSmith를 활용한 평가 워크플로
LangSmith를 사용하여 에이전트의 추적(trace), 평가, 주석 큐(annotation queue)를 관리한다. 평가를 통과하지 못한 트레이스는 자동으로 주석 큐에 적재된다. 운영 팀은 이 큐를 통해 실패 사례를 수동으로 분석하고, 이를 제품 인사이트로 연결하여 에이전트를 개선한다.
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 06. 15.수집 2026. 06. 15.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




