配送与出行 / 网约车与配送

Uber:软件代码评审

企业
Uber
国家
美国
实施阶段
运营中
资料发布
日期依据
资料发布的时间,可能与启用日期不同。
依据核验方式
阅读原文正文

业务问题

随着AI开始协助写代码,需要评审的代码量增加了。评审者没有足够时间去发现细微的缺陷和安全问题,也难以顾及内部规范。Uber认为这一瓶颈会导致漏掉错误、线上故障和发布延迟。

使用的技术与数据

uReview的核心是分成多个阶段的生成式AI评审系统Commenter。它把改动的代码与周边函数、类定义、import语句一起组成prompt。评审分三条线。Standard Assistant查找缺陷、错误的异常处理和逻辑漏洞。Best Practices Assistant参照公共的风格规范仓库,核对内部编码规范。AppSec Assistant关注应用层的安全漏洞。生成的意见再由另一个prompt评估质量、给出置信度分数,并合并重复的意见。在模型选择上,由Anthropic Claude-4-Sonnet生成意见、OpenAI o4-mini-high打分时效果最好。开发者对每条意见选择Useful或Not Useful,并留下备注。

成果

Uber表示,uReview对每周约65,000个diff中的90%以上进行了分析,每周处理超过10,000次提交。使用过该工具的工程师把75%的意见标记为有用,已发布意见中有超过65%被采纳。Uber据此计算出每周约节省1,500小时,并说明这接近每年39 developer years。内部审计显示,人写的意见中只有51%被作者认定为缺陷并在同一次改动中修复。

局限与待解问题

uReview只能看到代码,无法访问历史PR、feature flag配置、数据库schema和技术文档,也无法判断整体设计是否正确。

来源

本案例根据公开资料整理,并非 ATF Works 客户的成果。

阅读原文 (在新标签页中打开)