AI 与智能体

GitHub 推出 AI 代码评审基准 ReviewBench

发布日期
来源
GitHub 博客

摘要

GitHub 发布了用于比较 AI 代码评审智能体的开放基准 ReviewBench。它以 1.039 亿个真实 pull request 的语言和规模分布为依据,由 19 种语言的 219 个公开 pull request 构成,标准答案集合了人类评审者、前沿 LLM 和静态分析。据 GitHub 介绍,资深工程师独立验证的一致率为 96.6%,该基准还让 Copilot 代码评审的离线评估更能预测线上实验的方向。

与我们工作的关联

选择或引入代码评审工具的团队,现在可以有依据地比较各系统能发现什么、会漏掉什么。公开的评估标准通常也会加快整个领域智能体的改进速度。

本文译自韩文原文。 摘要可能经过翻译和编辑。评论是我们的解读,未来预测代表来源的观点。

阅读原文 (在新标签页中打开)