AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

발행일
출처
arXiv
논문 번호
897
분야
Computer Vision
arXiv 번호
2608.13560

논문→포스터 생성 작업에서 '모델'이 아니라 '하네스(에이전트 운영 체계)'를 재귀적으로 개선하는 프레임워크. PosterBench 최고점.

이 논문은 한마디로 에이전트를 감싸는 운영 체계(하네스)를 실행 피드백으로 스스로 개선하게 만든 프레임워크다. 코드 에이전트가 포스터를 만들고, 메타 최적화기가 그 실패 기록을 보고 하네스를 한 조각씩 고친다. 학습된 하네스는 7가지 모델 조합의 평균 점수를 54.99에서 67.39로(약 +12.4%) 올렸고, PosterBench 메인 트랙에서 78.32점으로 Claude Design보다 7.45점 높았다. 사람 블라인드 평가에서도 최고 선호를 받았다.

핵심 요약

  • '모델 파라미터는 고정하고 하네스를 최적화한다'는 접근으로, 실패 경험이 시스템 자체의 개선으로 축적되게 했다.
  • 한 번에 한 개 구성요소만 바꾸고, 개발 성능 유지 조건을 통과해야 승격하는 안전한 업데이트 게이트를 도입했다.
  • 학습된 DesignHarness를 얹자 7개 코드 에이전트 구성 모두 5.0~19.6점 향상됐다(평균 54.99→67.39).
  • PosterBench(논문 100편, 5개 분야)에서 78.32점으로 최상위, 상용 시스템 Claude Design보다 7.45점 높았다.
  • 완전 자율 루프에서 253번의 도구 호출과 11번 편집을 40분 만에 3달러 미만으로 수행해 학회 포스터 수준 결과를 냈다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)