Can AI agents conduct open-ended AI research? Early evidence from two case studies

발행일
출처
arXiv
논문 번호
769
분야
AI / General
arXiv 번호
2607.27191

AI 에이전트가 개방형 AI 연구를 수행할 수 있는지 검증한 논문. 6일간의 실험 결과, 엔지니어링은 가능했지만 연구 판단력과 창의성이 크게 부족했다.

이 논문은 한마디로 최첨단 AI 에이전트에게 미공표 논문의 연구 질문을 주고 6일 동안 자율 연구를 시켜본 결과, 코딩은 잘하지만 연구자로서의 판단력과 창의성이 크게 부족했다는 이야기다. 프린스턴 등 여러 기관이 협업하여 '그림자 평가(shadow evaluation)'라는 새로운 방법을 제안했다. 두 편의 NeurIPS 제출 논문에 대해 원저자가 채점한 결과, 두 편 모두 명확한 거절(2/6, 1/6)을 받았다. 다섯 가지 핵심 실패 패턴을 식별했다.

핵심 요약

  • '그림자 평가'라는 새 방법을 제안했다. 미공표 논문의 연구 질문을 AI에게 주고, 원저자가 채점하는 방식이다.
  • Opus 4.8과 GPT-5.6 Sol 두 모델 모두에서 비슷한 실패 패턴이 재현되었다.
  • 에이전트는 엔지니어링(코딩, 실험 실행)은 잘했지만, 연구 설계의 판단력과 창의성이 크게 부족했다.
  • 핵심 실패 5가지: 연구 수준 기준 부족, 막다른 길에서의 후퇴 실패, 자원 인식 부족, 피드백에 대한 비창의적 대응, 지시 이탈.
  • API 예산의 절반도 쓰지 않으면서 시간이 남았고, AI 자기 리뷰에서는 한 번도 '통과'를 주지 않았다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)