Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement

발행일
출처
arXiv
논문 번호
1062
분야
AI / General
arXiv 번호
2609.01481

기존 코딩 에이전트 하네스를 계획-개발-테스트 루프로 감싸 사람 개입 없이 며칠씩 소프트웨어를 계속 개선하게 만든 상위 오케스트레이션 프레임워크로, 벤치마크 최대 82.86% 향상과 70회 루프 만의 FPS 게임 자율 개발을 보여줬다.

이 논문은 한마디로 코딩 에이전트를 '며칠 동안 스스로 개선'시키는 상위 오케스트레이터다. Harness-of-Harness(HoH)는 Codex·OpenCode·Pi 같은 기존 하네스의 내부를 고치지 않고, 실행을 계획 → 개발 → 테스트 루프로 조직한다. 매 루프는 남은 문제 해결과 작은 신규 기능 추가를 함께 담고, 구현 중 테스트와 독립적인 QA 평가를 분리하며, 검증 가능한 산출물 형식만 강제하고 에이전트의 작업 방식은 자유롭게 둔다. 그 결과 세 벤치마크에서 세 가지 하네스-모델 조합 모두 단독 하네스 대비 평균 52.25%, 최대 82.86% 상대 향상을 기록했고, 70회 넘는 루프로는 요구사항 문서 하나만 받아 사람이 플레이 가능한 FPS 게임을 자율 완성했다.

핵심 요약

  • 하네스 구현을 건드리지 않고 산출물(계획, 테스트 리포트)의 형식만 강제해 위반 시 재시도를 유발하는 방식으로, 에이전트 자율성과 검증 가능성을 동시에 확보했다.
  • GameCraft-Bench·FrontierSWE·ProgramBench에서 Codex+GPT-5.5, OpenCode+DeepSeek-V4-Pro, Pi+MiniMax-M3 조합 모두 3회 루프 만에 평균 상대 52.25%, 최대 82.86% 향상을 기록했다.
  • FrontierSWE에서 Codex+GPT-5.5는 10회 루프 동안 22%에서 72.67%로 계속 올라가, 반복이 늘수록 이득이 누적됨을 보였다.
  • 빈 작업 폴더에 요구사항 문서만 주고 70회 넘는 루프로 스토리·전투 AI·연출·오디오를 갖춘 1인칭 슈팅 게임 'Fusepoint'를 자율 완성했다. 사람의 개입은 네트워크 복구뿐이었다.
  • 기록된 81개 이슈 중 65개를 스스로 종료했고, 예전에 검증된 기능이 무너진 재발 이슈 17건을 버전 이력 기반으로 복구해 장기 개발에서 회귀 관리가 핵심임을 보여줬다.
  • Godot 엔진 연동, 에셋 생성, UI/UX, 테스트용 스킬을 역할별로 배정해 재사용을 유도하는 점진 공개 구조를 썼다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)