MatToolBench: Benchmarking Multimodal Agents in Real-World Materials Science Workflows
- 발행일
- 출처
- arXiv
- 논문 번호
- 1138
- 분야
- AI / General
- arXiv 번호
- 2609.37053
MatToolBench는 재료과학 전문 프로그램을 실제로 조작하는 AI의 능력을 평가하는 벤치마크다.
일반 컴퓨터 작업에 강한 AI도 재료과학 전문 프로그램에서는 어려움을 겪을 수 있다. MatToolBench는 Windows 11 가상 머신에서 10개 도구와 204개 과제를 제공한다. 화면 조작과 OriginPro 스크립트 작성, 코드 기반 데이터베이스 조회를 평가하며 부분 완료와 전체 성공을 구분한다. 평가 모델 중 가장 높은 성공률도 화면 조작 과제에서는 25%, 코드 과제에서는 45%에 그쳤다. 전문 작업 안내를 없애면 성능이 낮아졌으며 영어 지시와 최대 50단계의 단일 세션에 한정된 평가라는 한계가 있다.
핵심 요약
- MatToolBench는 Windows 11 가상 머신에서 재료과학 도구 10개를 사용하는 204개 과제를 제공한다.
- 화면 조작과 OriginPro 스크립트, 코드 기반 조회를 평가하며 세부 기준별 부분 점수와 모든 기준을 충족한 성공률을 구분한다.
- 평가 모델 중 가장 높은 평균 성공률은 화면 조작 과제에서 25%, 코드 과제에서 45%였다.
- 전문 작업 안내를 제거한 실험에서 성능이 낮아져 도구별 사용 지식과 작업 절차 지원의 중요성을 보여 준다.
- 평가는 영어 지시와 최대 50단계의 단일 세션에 한정되며 일부 전문 도구와 장기 작업 흐름은 포함하지 않는다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.