배달과 이동 / 차량 호출과 배달
Uber: 소프트웨어 개발 전 과정의 AI 에이전트 운영과 비용 관리
- 기업
- Uber
- 국가
- 미국
- 도입 상태
- 운영
- 자료 공개
- 날짜 기준
- 자료 발표 시점. 도입 시작일과 다를 수 있음
- 근거 확인 방법
- 원문 본문 열람
업무 문제
우버는 2026년 2월부터 8월 사이 주간 활성 사용자가 7배, 주간 에이전트 요청이 9.4배 늘었다고 밝혔다. 품질을 지키면서 늘어나는 비용을 다뤄야 했다. 도구가 100개 넘게 설치된 상태에서 표준 MCP 방식으로 도구를 미리 불러오면 도구 명세만 약 5만~7만 토큰이 첫 프롬프트에 붙고, 이후 대화가 이어질 때마다 다시 보내졌다. 사내 맥락이 없는 에이전트는 필요한 테이블을 보지 못해 서비스 코드를 20분 동안 살피고 하위 에이전트 2개를 띄웠다.
적용한 기술과 데이터
우버는 사람이 시작하지 않는 관리형 에이전트가 코드 리뷰, 실패한 CI 자동 복구, 화면 검증을 포함한 PR 완성, 당직 경보 분류, 디버깅과 유지보수를 맡고, 사람은 결과를 검토하고 넘겨받은 일을 처리한다고 설명했다. 모델은 실제 업무로 만든 벤치마크로 고르고, 입력이 명확한 하위 에이전트에는 더 싼 모델을 기본으로 쓴다. 대화형 세션의 프롬프트 캐시 유지 시간을 5분에서 1시간으로 늘렸고, 40만 토큰에서 자동 압축을 건다. 게이트웨이 하나가 1,000개가 넘는 MCP 서버 앞에서 인증과 정책을 한곳에서 관리한다. AI 맥락 그래프는 사내 시스템 30여 개에서 모은 노드 2,400만 개와 연결 8,000만 개를 담는다. 비용은 상태 표시줄의 실시간 비용 계산기, 예상 지출의 50%, 80%, 100%에 이르면 보내는 슬랙 알림, 등급을 올릴 때의 관리자 승인, 16가지 비효율 사용 패턴을 짚는 대시보드로 보이게 했다.
성과
우버는 PR의 70% 넘게를 로컬 또는 클라우드 에이전트가 만든 것으로 집계한다고 밝혔다. 엔지니어들은 스킬을 3,600개 넘게 만들었고 하루 3만 번 넘게 실행한다. 총지출은 4월 이후 비교적 안정적이었다. 모델 요청 1,000건당 비용은 2월부터 7월 사이 최고점보다 34% 가까이 내려갔고, 세션당 비용은 6월 최고점보다 52% 내려갔다. 회사는 사용량이 7배 늘어나는 동안 단위 비용은 내려가고 품질은 유지됐다고 설명했다. 사내 맥락을 갖춘 에이전트는 과거 사용 기록을 조회해 분석가 50명 넘게 쓰는 테이블을 찾아 38초 만에 답했다.
한계와 남은 과제
70%는 에이전트가 만든 것으로 집계한 PR의 비율이며, 사람 검토 없이 합쳐진 PR의 비율이 아니다. 버그나 품질 지표는 따로 밝히지 않았다. 비용 수치는 우버 환경에만 해당한다고 회사가 적었고, 대부분 2월부터 7월 사이 값이다. 도입을 시작한 월을 밝히지 않아 자료 공개일로 정렬했다.
출처
공개된 자료를 정리한 사례입니다. ATF Works 도입 고객의 결과가 아닙니다.