SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios

발행일
출처
arXiv
논문 번호
104
분야
Benchmarks / Code
arXiv 번호
2512.18470

SWE-EVO는 지속적인 계획 수립과 시간에 걸친 다중 파일 변경을 요구하는 장기 소프트웨어 진화 과제에서 AI 코딩 에이전트를 평가하기 위한 새로운 벤치마크를 도입한다.

SWE-EVO는 지속적인 계획 수립과 시간에 걸친 다중 파일 변경을 요구하는 장기 소프트웨어 진화 과제에서 AI 코딩 에이전트를 평가하기 위한 새로운 벤치마크를 도입한다. 평가 결과 최신 모델은 이러한 복잡한 시나리오에서 25%의 해결률을 달성하여, 현재 에이전트 역량에 상당한 격차가 있음을 보여준다.

핵심 요약

  • 기존 AI 코딩 에이전트 벤치마크는 주로 SWE-Bench에서 볼 수 있는 것과 같은 개별 버그 수정이나 단일 이슈 기능 구현에 초점을 맞춘다.
  • 이러한 벤치마크는 지속적인 진화, 다중 파일 조율, 기존 코드베이스에 대한 반복적 업데이트를 수반하는 실제 소프트웨어 공학의 장기적 특성을 충분히 포착하지 못한다.
  • 소프트웨어 개발의 상당 부분은 레거시 코드를 유지보수하고 진화시키는 데 할애되며, 이는 현재 방법으로는 평가되지 않는 지속적 이해, 적응적 계획 수립, 전체론적 시스템 변경을 요구한다.
  • SWE-EVO는 실제 릴리스 노트에서 도출한 48개의 고품질 소프트웨어 진화 과제로 구성된 벤치마크를 제시하며, 에이전트가 코드베이스를 두 개의 서로 다른 버전 사이에서 전환하도록 요구한다.
  • 에이전트는 상위 수준의 소프트웨어 요구사항 명세(SRS)를 해석하고, 기능이 보존되고 새로운 테스트가 통과되도록 보장하면서 전체 코드베이스에 걸쳐 다단계·다중 파일 수정을 구현해야 한다.
  • 성능은 해결률(엄격한 통과·실패), 패치 적용률(Patch Apply Rate), 수정률(세밀한 진행도)을 사용해 평가하며, 실패 유형을 분류하기 위한 LLM-as-a-judge 분석으로 보완한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)