배달과 이동 / 차량 호출과 배달
Uber: 소프트웨어 코드 검토
- 기업
- Uber
- 국가
- 미국
- 도입 상태
- 운영
- 자료 공개
- 날짜 기준
- 자료 발표 시점. 도입 시작일과 다를 수 있음
- 근거 확인 방법
- 원문 본문 열람
업무 문제
AI가 코드 작성을 돕게 되면서 검토해야 할 코드량이 늘었다. 검토자는 미묘한 버그와 보안 문제를 찾고 사내 규칙을 지킬 시간이 부족했다. Uber는 이 한계가 놓친 오류와 운영 장애, 늦은 배포로 이어진다고 봤다.
적용한 기술과 데이터
uReview의 핵심은 여러 단계로 나뉜 생성형 AI 검토 시스템 Commenter다. 바뀐 코드에 주변 함수, 클래스 정의, import 문을 함께 넣은 프롬프트를 만든다. 검토는 세 갈래다. Standard Assistant는 버그와 잘못된 예외 처리, 논리 결함을 찾는다. Best Practices Assistant는 공용 스타일 규칙 저장소를 참조해 사내 코딩 규칙을 확인한다. AppSec Assistant는 애플리케이션 수준의 보안 취약점을 본다. 만들어진 의견은 별도 프롬프트가 품질을 평가해 신뢰도 점수를 매기고 겹치는 의견은 합친다. 모델은 Anthropic Claude-4-Sonnet이 의견을 만들고 OpenAI o4-mini-high가 채점할 때 가장 좋았다. 개발자는 의견마다 Useful 또는 Not Useful을 고르고 메모를 남긴다.
성과
Uber는 uReview가 주간 약 65,000건의 diff 가운데 90%가 넘게 분석한다고 밝혔다. 매주 10,000건이 넘는 커밋을 처리한다. 도구를 써 본 엔지니어는 의견의 75%를 유용하다고 표시했고 게시된 의견의 65%가 넘게 반영됐다. Uber는 이를 주당 약 1,500시간 절약으로 계산했고 연간 39 developer years에 가깝다고 설명했다. 사내 감사에서 사람이 쓴 의견은 51%만 작성자가 버그로 인정하고 같은 변경에서 고쳤다.
한계와 남은 과제
uReview는 코드만 볼 수 있고 과거 PR, feature flag 설정, 데이터베이스 스키마, 기술 문서에는 접근하지 못한다. 전체 설계가 맞는지는 판단하지 못한다.
출처
공개된 자료를 정리한 사례입니다. ATF Works 도입 고객의 결과가 아닙니다.