본문으로 건너뛰기

Uber의 대규모 코드 품질 관리를 위한 AI 자동 코드 리뷰 시스템 uReview 도입 사례.

Uber는 수천 명의 엔지니어를 위한 AI 코드 리뷰 시스템 uReview를 구축하여 리뷰 대기 시간을 단축하고 운영 비용을 60% 절감했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Uber는 코드 리뷰 대기 시간이 3시간에서 9시간으로 급증하는 문제를 해결하기 위해 자체 AI 코드 리뷰 시스템인 uReview를 구축했다. 이 시스템은 수천 명의 엔지니어가 사용하는 다양한 Monorepo와 Phabricator 환경을 지원하며, LLM 에이전트가 생성한 리뷰의 중복을 제거하고 품질을 필터링하는 아키텍처를 갖췄다. 단순한 비용 측정을 넘어 개발자의 피드백 감성 분석과 실제 수정 반영률(Addressal Rate)을 추적함으로써 시스템을 고도화했다. 현재 주당 25,000개의 코멘트를 생성하며 비용을 60% 절감했고, 향후 엔지니어가 단순 구현 리뷰보다 아키텍처와 제품 설계에 집중할 수 있도록 돕는 방향으로 진화하고 있다.

챕터별 상세

00:00

코드 리뷰 병목 현상과 uReview 도입 배경

2024년 3시간이었던 첫 리뷰 대기 시간이 2026년 9시간으로 늘어나며 코드 리뷰가 개발 속도의 병목이 되었다. Uber는 수천 명의 엔지니어와 6개의 언어별 Monorepo 환경을 지원하기 위해 자체 시스템 uReview를 개발했다. 기존 상용 도구들이 Phabricator를 지원하지 않는 점과 인간과 에이전트에게 동일한 리뷰 규칙을 적용하려는 목적이 컸다. 이를 통해 에이전트가 개발 초기 단계(Inner Loop)에서 인간과 같은 기준으로 코드를 검토하게 했다.
03:42

uReview 아키텍처와 중복 제거 메커니즘

uReview 아키텍처는 GitHub, Phabricator, 에이전트 루프에서 요청을 받아 적절한 생성기(Generator)로 라우팅하는 Dispatch 구조를 가진다. 여러 생성기가 동시에 작동하며 발생하는 중복 코멘트 문제를 해결하기 위해 후처리(Post-process) 단계에서 등급 지정, 분류, 필터링 및 중복 제거를 수행한다. 엔지니어에게는 오직 신뢰도가 높고 실행 가능한(Actionable) 코멘트만 전달되도록 설계했다. 결과적으로 개발자는 불필요한 노이즈 없이 핵심적인 수정 제안만 받게 된다.
04:37

지표 중심의 진화: 비용에서 감성 분석까지

초기 uReview는 비용과 단순 설문 조사(NPS)에만 의존하여 품질 대비 비용 효율이 일정하지 않았다. 이를 개선하기 위해 개발자의 답변에 대한 감성 분석(Sentiment Analysis)과 제안이 실제로 코드에 반영되었는지 나타내는 수정 반영률(Addressal Rate)을 추적하기 시작했다. 에이전트의 사고 과정과 도구 호출 기록을 포함한 런타임 프로파일링을 통해 시스템을 튜닝했다. 이러한 지표 중심의 접근으로 초기 모델 대비 비용은 60% 줄이고 정확도는 70% 이상 높였다.
06:32

모델의 한계와 가드레일 설정

LLM 모델은 자신의 답변이 틀렸을 때도 100% 확신하며 잘못된 리뷰를 제공하는 경향이 있다. 각 팀마다 고유한 스타일 가이드와 안티 패턴이 다르기 때문에 모델에게 명확한 가이드라인을 제공하는 것이 필수적이다. uReview는 에이전트가 불필요한 작업에 시간을 낭비하지 않도록 가드레일을 설정하여 리뷰 품질을 유지한다. 이를 통해 모델의 근거 없는 자신감을 제어하고 팀별 요구사항에 맞는 정확한 피드백을 생성한다.
07:26

팀별 맞춤형 리뷰 스택과 커스텀 에이전트

수백 개의 팀이 각자의 요구사항에 맞춰 리뷰 규칙을 설정할 수 있도록 맞춤형 리뷰 스택을 제공한다. 단순한 로직 체크부터 여러 파일을 동시에 분석하는 딥 리뷰(Deep Review)까지 계층화된 구조를 갖췄다. 팀들은 Claude 등을 활용해 과거 PR 데이터를 기반으로 자신들만의 '스킬'을 정의하거나 지식 베이스와 연결된 커스텀 에이전트를 구축할 수 있다. Uber의 기존 소유권 모델(Ownership Model)과 연동하여 팀별 맞춤형 규칙이 자동으로 적용되도록 구현했다.
10:10

운영 결과와 미래: 인간의 역할 변화

uReview는 현재 주당 약 25,000개의 코멘트를 생성하며, 이 중 약 67%가 개발자에 의해 실제로 수정에 반영된다. 특히 심각도가 높은 이슈의 경우 반영률이 74%에 달해 실질적인 코드 품질 향상에 기여하고 있음이 확인됐다. 향후 AI가 코드 작성과 리뷰를 모두 담당하는 자동 승인(Automatic Approval) 단계로 나아갈 것으로 전망한다. 인간 엔지니어는 단순 구현 검토에서 벗어나 아키텍처, 도메인 설계, 제품 사고 등 더 높은 수준의 의사결정에 집중하게 될 것이다.

용어 해설

풀 리퀘스트(Pull Request)
개발자가 작성한 코드 변경 사항을 메인 코드베이스에 병합하기 전, 동료들에게 검토를 요청하는 프로세스이다.
모노레포(Monorepo)
여러 프로젝트의 코드를 하나의 거대한 저장소에서 관리하는 방식이다. Uber는 언어별로 6개의 Monorepo를 운영한다.
수정 반영률(Addressal Rate)
AI 에이전트가 제안한 코드 리뷰 코멘트가 실제로 개발자에 의해 수정에 반영된 비율을 의미한다. 시스템의 실질적 유용성을 측정하는 핵심 지표이다.
이너 루프(Inner Loop)
개발자가 코드를 작성하고 로컬에서 테스트하는 반복적인 초기 개발 단계를 의미한다. uReview는 이 단계에 에이전트를 투입해 피드백 루프를 단축한다.
감성 분석(Sentiment Analysis)
텍스트 데이터에 담긴 사용자의 감정이나 태도를 분석하는 기술이다. uReview는 에이전트의 코멘트에 대한 개발자의 반응이 긍정적인지 부정적인지 판별하는 데 사용한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 28.수집 2026. 08. 29.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.