PaperBench: Evaluating AI's Ability to Replicate AI Research

발행일
출처
arXiv
논문 번호
046
분야
Benchmarks / Research Agents
arXiv 번호
2504.01848

OpenAI 연구진은 원본 코드에 접근하지 않고 최신 머신러닝 연구를 처음부터 복제하는 AI 에이전트의 능력을 평가하는 벤치마크 PaperBench를 개발했다.

OpenAI 연구진은 원본 코드에 접근하지 않고 최신 머신러닝 연구를 처음부터 복제하는 AI 에이전트의 능력을 평가하는 벤치마크 PaperBench를 개발했다. 평가 결과 현재 최첨단 모델은 평균 13.2퍼센트에서 24.4퍼센트의 복제 점수를 달성했으며, 견고한 실행 및 결과 검증보다 코드 생성에서 더 나은 성과를 보였다. 이는 인간 기준선 41.4퍼센트와 비교된다.

핵심 요약

  • 기존 AI 에이전트 벤치마크는 장기적이고 개방형인 머신러닝 연구개발(ML R&D) 작업에 대한 성능을 평가하기에 범위와 복잡성이 부족한 경우가 많다.
  • 특히 안전성 및 거버넌스 프레임워크를 위해, AI 모델의 자율성과 과학 연구 수행 역량에 대한 엄밀하고 객관적이며 확장 가능한 척도가 필요하다.
  • 연구 논문의 인간 복제는 시간이 많이 들고 주관적인 과정이어서 AI 에이전트의 일관된 평가를 위해 확장하기 어렵다.
  • OpenAI 연구진은 AI 에이전트가 원본 코드베이스에 접근하지 않고 처음부터 실증 결과를 복제하도록 요구하는, 최근 ICML 논문 20편으로 구성된 벤치마크 PaperBench를 도입했다.
  • 각 논문에 대해 원저자와 공동 개발한 상세한 계층적 루브릭이 8,316개의 구체적 기여 항목에 걸쳐 세분화된 이진 합격/불합격 기준을 제공한다.
  • 인간 채점 벤치마크(JudgeEval)에 대해 F1 점수 0.83으로 검증된 LLM 기반 자동 판정기 SimpleJudge가 에이전트 제출물에 대한 확장 가능하고 일관된 평가를 제공한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)