Effective Strategies for Asynchronous Software Engineering Agents
- 발행일
- 출처
- arXiv
- 논문 번호
- 130
- 분야
- Code Agents
- arXiv 번호
- 2603.21489
CAID는 의존성 인식 위임, git 워크트리, 커밋, 병합, 테스트를 사용해 다중 에이전트 코딩을 프롬프트 수준 협조에서 실행 가능한 분기-병합 워크플로로 재구성하여, 장기 시야의 SWE 과제에서 병렬 에이전트를 실용적으로 만든다.
이 논문은 한 관리자가 저장소 규모의 목표를 의존성 그래프로 분해하고 준비된 하위 과제를 여러 엔지니어 에이전트에게 분배하는 중앙집중식 비동기 격리 위임(CAID)을 제안한다. 각 엔지니어는 별도의 git 워크트리에서 작업하고, 실행 가능한 테스트로 스스로 검증하며, 결과를 커밋하고, 이후 관리자가 git merge를 통해 변경을 통합하되 충돌은 담당 엔지니어에게 되돌린다. PaperBench와 Commit0-Lite에서 CAID는 단일 에이전트 기준 대비 각각 26.7%p와 14.3%p 향상되었으며, MiniMax 2.5의 PaperBench 실행은 10.4%에서 36.7%로 상승했다. 절제 실험은 물리적 격리가 프롬프트만으로 하는 약한 분리보다 우수하고, CAID로 시작하는 것이 폴백으로 사용하는 것보다 효율적이며, 엔지니어를 너무 많이 추가하면 통합과 의존성 오버헤드가 지배하여 오히려 해가 될 수 있음을 보여준다.
핵심 요약
- 핵심 방법은 다음과 같다. 관리자가 과제 의존성 그래프를 구축하고, 자격을 갖춘 노드만 위임하며, 엔지니어 에이전트가 하위 과제를 완료하면 상태를 갱신한다.
- 실행 모델은 다음과 같다. 엔지니어는 격리된 git 워크트리에서 편집하고, 커밋 전에 로컬 테스트를 실행하며, 구조화된 분기-병합 파이프라인을 통해 변경을 되돌려준다.
- 실증 결과로, CAID는 단일 에이전트 기준 대비 PaperBench에서 26.7%p, Commit0-Lite에서 14.3%p의 향상을 얻어 정확도와 장기 시야 협조 양쪽의 이득을 시사한다.
- 핵심 유의점으로, 병렬성에는 최적 지점이 있다. 엔지니어 2~4명은 도움이 되지만, 8명이면 병합 충돌, 의존성 대기, 검증 오버헤드가 추가 인력을 능가할 때 결과가 악화될 수 있다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.