Effective Strategies for Asynchronous Software Engineering Agents

발행일
출처
arXiv
논문 번호
130
분야
Code Agents
arXiv 번호
2603.21489

CAID는 의존성 인식 위임, git 워크트리, 커밋, 병합, 테스트를 사용해 다중 에이전트 코딩을 프롬프트 수준 협조에서 실행 가능한 분기-병합 워크플로로 재구성하여, 장기 시야의 SWE 과제에서 병렬 에이전트를 실용적으로 만든다.

이 논문은 한 관리자가 저장소 규모의 목표를 의존성 그래프로 분해하고 준비된 하위 과제를 여러 엔지니어 에이전트에게 분배하는 중앙집중식 비동기 격리 위임(CAID)을 제안한다. 각 엔지니어는 별도의 git 워크트리에서 작업하고, 실행 가능한 테스트로 스스로 검증하며, 결과를 커밋하고, 이후 관리자가 git merge를 통해 변경을 통합하되 충돌은 담당 엔지니어에게 되돌린다. PaperBench와 Commit0-Lite에서 CAID는 단일 에이전트 기준 대비 각각 26.7%p와 14.3%p 향상되었으며, MiniMax 2.5의 PaperBench 실행은 10.4%에서 36.7%로 상승했다. 절제 실험은 물리적 격리가 프롬프트만으로 하는 약한 분리보다 우수하고, CAID로 시작하는 것이 폴백으로 사용하는 것보다 효율적이며, 엔지니어를 너무 많이 추가하면 통합과 의존성 오버헤드가 지배하여 오히려 해가 될 수 있음을 보여준다.

핵심 요약

  • 핵심 방법은 다음과 같다. 관리자가 과제 의존성 그래프를 구축하고, 자격을 갖춘 노드만 위임하며, 엔지니어 에이전트가 하위 과제를 완료하면 상태를 갱신한다.
  • 실행 모델은 다음과 같다. 엔지니어는 격리된 git 워크트리에서 편집하고, 커밋 전에 로컬 테스트를 실행하며, 구조화된 분기-병합 파이프라인을 통해 변경을 되돌려준다.
  • 실증 결과로, CAID는 단일 에이전트 기준 대비 PaperBench에서 26.7%p, Commit0-Lite에서 14.3%p의 향상을 얻어 정확도와 장기 시야 협조 양쪽의 이득을 시사한다.
  • 핵심 유의점으로, 병렬성에는 최적 지점이 있다. 엔지니어 2~4명은 도움이 되지만, 8명이면 병합 충돌, 의존성 대기, 검증 오버헤드가 추가 인력을 능가할 때 결과가 악화될 수 있다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)