AI와 에이전트

깃허브, AI 코드 리뷰 벤치마크 공개

발행일
출처
GitHub 블로그

요약

깃허브는 AI 코드 리뷰 에이전트를 비교·평가하는 오픈 벤치마크 ReviewBench를 공개했다. 실제 깃허브 풀 리퀘스트 1억 390만 건의 언어·규모 분포를 반영한 공개 풀 리퀘스트 219건(19개 언어)으로 구성했고, 정답 세트는 사람 리뷰어·최신 LLM·정적 분석을 섞어 만들었다. 회사 발표에 따르면 시니어 엔지니어 독립 검증에서 96.6% 일치율을 기록했고, 이 벤치마크 덕분에 Copilot 코드 리뷰의 오프라인 평가가 실제 서비스 실험 방향을 더 잘 예측하게 됐다.

우리 일과의 관련성

코드 리뷰 도구를 고르거나 직접 만드는 팀이 무엇을 잘 잡고 무엇을 놓치는지 근거 있게 비교할 수 있게 됐다. 평가 기준이 공개되면 에이전트 개선 속도도 함께 빨라진다.

요약은 원문을 번역하고 편집한 내용입니다. 코멘트는 우리의 해석이며, 미래 전망은 해당 출처의 견해입니다.

원문 보기 (새 탭에서 열림)