AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
- 발행일
- 출처
- arXiv
- 논문 번호
- 897
- 분야
- Computer Vision
- arXiv 번호
- 2608.13560
논문→포스터 생성 작업에서 '모델'이 아니라 '하네스(에이전트 운영 체계)'를 재귀적으로 개선하는 프레임워크. PosterBench 최고점.
이 논문은 한마디로 에이전트를 감싸는 운영 체계(하네스)를 실행 피드백으로 스스로 개선하게 만든 프레임워크다. 코드 에이전트가 포스터를 만들고, 메타 최적화기가 그 실패 기록을 보고 하네스를 한 조각씩 고친다. 학습된 하네스는 7가지 모델 조합의 평균 점수를 54.99에서 67.39로(약 +12.4%) 올렸고, PosterBench 메인 트랙에서 78.32점으로 Claude Design보다 7.45점 높았다. 사람 블라인드 평가에서도 최고 선호를 받았다.
핵심 요약
- '모델 파라미터는 고정하고 하네스를 최적화한다'는 접근으로, 실패 경험이 시스템 자체의 개선으로 축적되게 했다.
- 한 번에 한 개 구성요소만 바꾸고, 개발 성능 유지 조건을 통과해야 승격하는 안전한 업데이트 게이트를 도입했다.
- 학습된 DesignHarness를 얹자 7개 코드 에이전트 구성 모두 5.0~19.6점 향상됐다(평균 54.99→67.39).
- PosterBench(논문 100편, 5개 분야)에서 78.32점으로 최상위, 상용 시스템 Claude Design보다 7.45점 높았다.
- 완전 자율 루프에서 253번의 도구 호출과 11번 편집을 40분 만에 3달러 미만으로 수행해 학회 포스터 수준 결과를 냈다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.