NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?

발행일
출처
arXiv
논문 번호
490
분야
LLMs / NLP
arXiv 번호
2606.24530

Nature 계열 논문 90개 과제로 코딩 에이전트의 과학적 발견 능력을 평가하는 NatureBench을 구축하고, 최강 에이전트도 17.8%만 SOTA를 능가한다는 결과를 보고한다.

AI 코딩 에이전트가 논문 재현을 넘어 실제 과학적 발견을 할 수 있는지 평가하기 위해, Nature 계열 저널에서 추출한 90개 태스크로 구성된 NatureBench을 구축했다. NatureGym 파이프라인이 각 논문을 컨테이너화된 과제 패키지로 자동 변환하여 환경 파편화 문제를 해결한다. 웹 검색을 금지한 엄격한 프로토콜 하에서 10개 프론티어 에이전트를 평가한 결과, 최강 모델(Claude Opus 4.7)도 17.8% 태스크에서만 SOTA를 능가했고 47.8%에서 매치했다. 성공은 주로 '방법론적 번역'(과학적 과제를 친숙한 지도학습 문제로 변환, 45.5%)에 의존하며, 실패는 잘못된 방법 선택(45.1%)과 계산 예산 부족(24.4%)이 지배했다.

핵심 요약

  • Nature 계열 5,500편에서 90개 과제를 엄선하여 6개 과학 도메인(세포 오믹스, 단백질, 생체 모델링, 물리 모델링, 분자 설계, 관계 추론)을 포괄
  • NatureGym: 논문 → 컨테이너화된 과제 환경 자동 구축 파이프라인으로 재현 가능성 보장
  • 최강 에이전트(Claude Opus 4.7)도 g>0.1 기준 17.8%만 SOTA 능가, 47.8% 매치 — 발견보다는 번역에 의존
  • 성공 경로의 45.5%는 과학적 발명이 아닌 '방법론적 번역'(친숙한 지도학습으로의 변환)
  • 실패 원인: 잘못된 방법 선택 45.1%, 계산 예산 부족 24.4% (과제 이해 부족이 아님)
  • 정보 방화벽으로 원저자 방법론을 은닉하여 재현이 아닌 독립적 발견을 강제

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)