ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence

발행일
출처
arXiv
논문 번호
261
분야
AI / General
arXiv 번호
2605.26340

이 연구는 AI가 생성한 연구에서 검증 가능한 주장을 위한 Chain-of-Evidence(CoE) 프레임워크를 도입하고, 문헌 검토부터 논문 작성까지 증거 사슬을 유지하도록 설계된 자율 연구 시스템 ScientistOne을 제시한다.

ScientistOne은 자율 연구 시스템이 만든 수치·인용·방법 설명을 실제 증거와 끝까지 연결하기 위한 Chain-of-Evidence 체계를 사용한다. 문헌 조사, 해법 탐색, 실험, 논문 작성 단계마다 주장에 근거를 붙이고, 사후 감사에서는 점수 재실행, 규칙 위반, 참고문헌, 방법과 코드의 일치 여부를 검사한다. 다섯 시스템이 만든 75편을 조사했을 때 기준 시스템들에서는 환각 인용, 재현되지 않는 점수, 코드와 다른 방법 설명이 체계적으로 발견됐다. 논문이 보고한 ScientistOne 결과는 환각 참고문헌 0건, 점수 검증 12건 모두 통과, 방법-코드 일치 15건 중 14건으로 비교군 중 가장 높았다. 이 연구의 핵심 의미는 보기 좋은 논문이나 높은 표면 점수보다 각 주장을 재현 가능한 로그·코드·문헌으로 추적하는 감사를 자율 연구의 필수 산출물로 만든 데 있다.

핵심 요약

  • 점수 검증(I1): 감사자는 보고된 점수가 재현 가능한지 확인하기 위해 '골든' 평가기에서 에이전트의 코드를 재실행한다.
  • 사양 위반(I2): 시스템은 에이전트가 규칙을 우회했는지(예: 정답 하드코딩 또는 제한된 데이터 임포트) 점검한다.
  • 참고문헌 검증(I3): 모든 인용은 환각을 탐지하기 위해 전 세계 학술 데이터베이스와 대조 확인된다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)