SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?

발행일
출처
arXiv
논문 번호
963
분야
LLMs / NLP
arXiv 번호
2608.19799

코딩 에이전트가 실제 과학 소프트웨어를 고칠 수 있는지 20개 분야 119개 과제로 측정한 벤치마크다. 최고 에이전트도 절반 이하만 성공했다.

이 논문은 한마디로 '과학 코드 수리'에 특화된 코딩 에이전트 벤치마크(SWE-bench Science)다. 20개 과학 분야 98개 GitHub 저장소에서 119개 과제를 뽑고, 왜 실패하는지 4가지 패턴으로 분류했다. 최고 성적(Claude Opus-5 max)도 pass@1 47.9%에 그쳤고, 공개 테스트 점수(96.6%)와 완전 성공률 사이 격차가 컸다. 흥미롭게도 과학 지식을 알려주는 게 항상 도움은 아니었다. 잘못 정렬된 정보는 오히려 에이전트를 오답에 묶어버렸다.

핵심 요약

  • 화학과 재료, 생물 등 20개 과학 분야의 98개 저장소에서 119개 과제를 구성해 과학 소프트웨어 수리 능력을 평가했다.
  • 최고 에이전트도 한 번 시도 성공률이 47.9%였고 공개 시험 점수 96.6%와 완전 성공률 사이에 큰 차이가 났다.
  • 실패를 과학 지식·추상화 부족, 겉핥기 수리, 통합 불완전, 새 사례 일반화 실패의 네 유형으로 분류했다.
  • 과학 정보를 추가했을 때 GPT-5.6의 성공률이 36.3%에서 31.9%로 떨어진 사례도 있어 지식은 실행 근거와 함께 검증돼야 함을 보였다.
  • 분야별 과제 수가 아직 적고 과학 지식을 실제 수리에 어떻게 쓰는지에 대한 분석도 초기 단계라 분야 간 순위와 일반화 해석에는 주의가 필요하다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)