SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
- 발행일
- 출처
- arXiv
- 논문 번호
- 859
- 분야
- LLMs / NLP
- arXiv 번호
- 2608.09802
이 논문은 기존 코딩 벤치마크의 한계(쉬움, 불량 테스트, 데이터 오염)를 극복하는 대규모 다언어 코드 리팩토링 벤치마크를 만들었다. 7개 언어, 평균 11.4개 파일 수정, 최고 모델도 41.2%만 해결한다.
이 논문은 한마디로 AI 코딩 에이전트의 진짜 실력을 테스트하기 위한 더 어렵고 더 깐깐한 벤치마크를 만들었다. 기존 SWE-bench Verified는 75% 이상 찍고 테스트 품질도 나빠서 한계에 달했는데, SWE-Bench ProMax는 진짜 리팩토링(평균 11.4개 파일, 261.6줄 수정)을 7개 언어로 요구한다. 가장 좋은 모델도 41.2%밖에 못 풀어서 아직 갈 길이 멀다는 걸 보여준다.
핵심 요약
- 기존 벤치마크의 60%가 불량 테스트(너무 좁거나 너무 넓음)를 가지고 있다는 문제를 정량적으로 드러냈다.
- 7개 프로그래밍 언어(Python, Java, TypeScript, Go, C, C++, Rust)를 아우르는 다언어 리팩토링 벤치마크를 구축했다.
- 평균 11.4개 파일, 261.6줄 코드 수정이 필요한 대규모 작업으로 기존 대비 3배 이상 복잡하다.
- GLM-5가 Claude Sonnet 4.6과 비슷한 성능을 1/20 비용으로 달성하는 등 오픈모델의 가성비를 보였다.
- 실패 패턴 분석을 통해 '건드려야 할 파일을 충분히 수정하지 못하는 것'이 주요 실패 원인임을 밝혔다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.