AIとエージェント
GitHub、AIコードレビューのベンチマークReviewBenchを公開
- 公開日
- 出典
- GitHubブログ
要約
GitHubは、AIコードレビューエージェントを比較・評価するオープンベンチマークReviewBenchを公開した。実際のGitHubプルリクエスト1億390万件の言語・規模の分布を反映した公開プルリクエスト219件(19言語)で構成し、正解データは人間のレビュアー、最新LLM、静的解析を組み合わせて作成した。同社によると、シニアエンジニアによる独立検証では96.6%の一致率で、このベンチマークによりCopilotコードレビューのオフライン評価が本番実験の方向をより良く予測できるようになったという。
仕事との関連
コードレビューツールの選定や導入において、何をどれだけ見つけられるかを根拠付きで比較できるようになった。評価基準が公開されることで、エージェントの改善スピードも上がりやすくなる。
韓国語の原文を翻訳した記事です。 要約には翻訳と編集を含みます。コメントは私たちの解釈であり、将来予測は出典の見解です。