SWE-Explore: Benchmarking How Coding Agents Explore Repositories
- 발행일
- 출처
- arXiv
- 논문 번호
- 377
- 분야
- Software Engineering
- arXiv 번호
- 2606.07297
코딩 에이전트의 리포지토리 탐색 능력을 독립적으로 평가하는 SWE-Explore 벤치마크를 제안했다. 848개 이슈, 10개 언어에 걸쳐 라인 수준 평가를 수행하며, 파일 찾기는 강하지만 핵심 라인 발견은 여전히 큰 과제임을 보여준다.
SWE-Explore는 기존 SWE-bench의 통합 pass/fail 평가에서 탐색 능력을 분리해 독립 평가한다. 성공한 에이전트 궤적에서 실제로 참조한 코드 라인을 ground truth로 추출하고, 탐색기가 반환한 ranked region list를 라인 수준에서 coverage, ranking, context-efficiency로 평가한다. 848개 이슈, 10개 언어, 203개 리포지토리를 포괄하며, sparse retriever부터 코딩 에이전트까지 다양한 방법을 동일한 라인 예산 하에 비교한다. 에이전트 기반 탐색이 classical retrieval을 명확히 상회하지만, 파일 수준 localization이 강한 반면 라인 수준 recall은 여전히 낮은 것이 핵심 발견이다.
핵심 요약
- 리포지토리 탐색을 패치 생성과 분리해 독립 평가하는 새로운 벤치마크
- 성공한 에이전트 궤적에서 trajectory-grounded line-level ground truth 도출
- 848개 이슈, 10개 언어, 203개 리포지토리로 다양한 코딩 환경 포괄
- 에이전트 탐색이 classical retrieval 대비 명확한 상위 티어 형성
- 파일 수준 hit은 강하지만 핵심 라인 recall은 0.14~0.19 수준으로 병목
- 핵심 context 누락이 잡음 context보다 패치 성공에 더 치명적
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.