ASI-Bench: At the Dawn of Artificial Superintelligence

발행일
출처
arXiv
논문 번호
943
분야
AI / General
arXiv 번호
2608.17271

사람의 방법론 지도를 단계적으로 걷어내며 AI가 스스로 프로젝트 단위 연구를 어디까지 하는지 측정한 최초의 벤치마크다.

이 논문은 한마디로 연구 방법을 알려주는 정도를 점차 줄여가며 AI가 프로젝트 단위 연구를 얼마나 스스로 수행하는지 잰 벤치마크다. 11개 분야 60개 과제를 40명 넘는 전문가가 3만 시간 이상 들여 만들었다. 전체 지도가 주어지면 평균 50.91점이지만 방법 이름만 주면 29.10, 방법까지 스스로 정하면 26.62로 뚝 떨어진다. 사람 지도가 빠지면 성능이 절반 가까이 무너지므로 자율 연구에는 아직 큰 격차가 있다는 결론이다.

핵심 요약

  • 같은 과제를 전체 절차 제공, 방법만 지정, 방법 자율, 혼선 정보 추가 4단계로 지도를 줄여가며 평가해 지시 이행과 자율 연구를 분리해 측정한다.
  • 18개 에이전트-모델 조합 평균이 전체 지도 50.91에서 방법만 지정 29.10, 방법 자율 26.62로 하락했다.
  • 같은 모델도 하니스(에이전트 실행 환경)에 따라 점수가 크게 달라졌다. MiMo V2.5 Pro는 자체 하니스 16.17에서 Claude Code 하니스 23.25로 올라갔다.
  • 방법 이름만 주는 조건이 오히려 가장 비싸서 과제당 평균 691만 토큰을 썼고, 불완전한 지도가 탐색 비용을 키웠다.
  • 최고 성능 조합은 51.60%였고 저가 조합은 4분의 1 비용으로 비슷한 성능을 내 비용 대비 효율 편차가 크다는 점도 보여줬다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)