SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?
- 발행일
- 출처
- arXiv
- 논문 번호
- 992
- 분야
- LLMs / NLP
- arXiv 번호
- 2608.23564
이 논문은 코딩 에이전트가 저장소 전체의 기술 스택을 갈아끼우는 마이그레이션 과제를 제대로 채점하는 벤치마크를 만들었고, 현재 최고 모델도 100점 만점에 47점에 그친다는 것을 드러냈다.
이 논문은 한마디로 '코딩 에이전트가 정말 대규모 리팩토링을 할 수 있는지'를 측정하는 벤치마크다. 기존 평가는 테스트만 돌리기 때문에, 원본 코드를 그대로 둔 채 통과하는 꼼수를 잡지 못했다. 저자들은 마이그레이션 감사→고정 행동 테스트→코딩 에이전트 6개의 대항 검증이라는 3단계로 평가했다. 8개 최전선 모델의 520회 실행 중 3단계를 모두 통과한 것은 5.4%뿐이었고, 최고 모델(claude-opus-5)도 47.0/100에 그쳤다.
핵심 요약
- 행동 테스트만으로는 원본 구현을 그대로 둔 제출물을 걸러내지 못하므로, 저장소 전체 스택 교체를 에이전트에 맡길 때는 교체가 실제로 일어났는지 따로 확인해야 한다.
- 언어·프레임워크·플랫폼·빌드 도구 4종 기술부채 20개 실제 오픈소스 저장소 과제를 만들었다.
- 마이그레이션 감사와 고정 행동 테스트 130,118개, 코딩 에이전트 6개의 대항 검증으로 3단계 채점하지만, 반례가 안 나온 것은 동작이 같다는 증명이 아니라 이 벤치마크가 줄 수 있는 가장 강한 증거일 뿐이라고 논문은 선을 긋는다.
- 520회 실행 중 전 단계 통과는 5.4%(28회)뿐이었고 20개 과제 중 13개는 아무 모델도 못 풀었다.
- 빌드 도구 갈아끼우기(31.4점)는 그나마 나오고 언어 교체(5.6점)는 거의 실패하는 등 역량 편차가 컸다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.