AI 与智能体
GitHub 推出 AI 代码评审基准 ReviewBench
- 发布日期
- 来源
- GitHub 博客
摘要
GitHub 发布了用于比较 AI 代码评审智能体的开放基准 ReviewBench。它以 1.039 亿个真实 pull request 的语言和规模分布为依据,由 19 种语言的 219 个公开 pull request 构成,标准答案集合了人类评审者、前沿 LLM 和静态分析。据 GitHub 介绍,资深工程师独立验证的一致率为 96.6%,该基准还让 Copilot 代码评审的离线评估更能预测线上实验的方向。
与我们工作的关联
选择或引入代码评审工具的团队,现在可以有依据地比较各系统能发现什么、会漏掉什么。公开的评估标准通常也会加快整个领域智能体的改进速度。
本文译自韩文原文。 摘要可能经过翻译和编辑。评论是我们的解读,未来预测代表来源的观点。