MatToolBench: Benchmarking Multimodal Agents in Real-World Materials Science Workflows

발행일
출처
arXiv
논문 번호
1138
분야
AI / General
arXiv 번호
2609.37053

MatToolBench는 재료과학 전문 프로그램을 실제로 조작하는 AI의 능력을 평가하는 벤치마크다.

일반 컴퓨터 작업에 강한 AI도 재료과학 전문 프로그램에서는 어려움을 겪을 수 있다. MatToolBench는 Windows 11 가상 머신에서 10개 도구와 204개 과제를 제공한다. 화면 조작과 OriginPro 스크립트 작성, 코드 기반 데이터베이스 조회를 평가하며 부분 완료와 전체 성공을 구분한다. 평가 모델 중 가장 높은 성공률도 화면 조작 과제에서는 25%, 코드 과제에서는 45%에 그쳤다. 전문 작업 안내를 없애면 성능이 낮아졌으며 영어 지시와 최대 50단계의 단일 세션에 한정된 평가라는 한계가 있다.

핵심 요약

  • MatToolBench는 Windows 11 가상 머신에서 재료과학 도구 10개를 사용하는 204개 과제를 제공한다.
  • 화면 조작과 OriginPro 스크립트, 코드 기반 조회를 평가하며 세부 기준별 부분 점수와 모든 기준을 충족한 성공률을 구분한다.
  • 평가 모델 중 가장 높은 평균 성공률은 화면 조작 과제에서 25%, 코드 과제에서 45%였다.
  • 전문 작업 안내를 제거한 실험에서 성능이 낮아져 도구별 사용 지식과 작업 절차 지원의 중요성을 보여 준다.
  • 평가는 영어 지시와 최대 50단계의 단일 세션에 한정되며 일부 전문 도구와 장기 작업 흐름은 포함하지 않는다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)