Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development
- 발행일
- 출처
- arXiv
- 논문 번호
- 904
- 분야
- AI / General
- arXiv 번호
- 2608.13417
장기 R&D 에이전트 7개를 최종 점수가 아니라 과정(구상·실행·피드백)으로 해부한 평가 연구. '지금은 엔지니어링 최적화기'라는 결론.
이 논문은 한마디로 장기 자동 연구 에이전트를 최종 점수만이 아니라 과정 역량으로 해부한 대규모 평가다. 7개 프론티어 모델을 36개 장기 과제(과제당 2~12시간, 총 756 롤아웃)로 시험하고, 해결 구상·실행·피드백 제어와 경험 재사용을 규칙 기반으로 측정했다. 결론은 현재 에이전트는 '실무형 엔지니어링 최적화기'이지 자율 연구자는 아니라는 것. 신뢰성 격차, 경험의 양면성, 하네스의 영향이 핵심 발견이다.
핵심 요약
- 최종 점수가 같아도 병목은 달랐다. GPT-5.5는 실행이, Gemini-3.1-Pro는 피드백 제어가 강한 식으로 과정 프로파일이 갈렸다.
- 모델 간 격차는 최고 성능(best@3, 0.122)보다 평균(avg@3, 0.237)에서 훨씬 컸다. 신뢰성이 승부처다.
- 252개 최고 시드 해결책 중 진짜 방법론적 신규성을 가진 것은 3개뿐이었다.
- 경험 이전은 양날이었다. DeepSeek-V4-Pro는 +0.093 향상, Gemini-3.1-Pro는 -0.017 악화.
- 하네스(에이전트 운영 체계)는 최고 성능보다 실행 안정성에 주로 영향을 주었다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.