Agents' Last Exam
- 발행일
- 출처
- arXiv
- 논문 번호
- 345
- 분야
- AI / General
- arXiv 번호
- 2606.05405
AI 에이전트가 실제 산업 환경에서 경제적 가치가 있는 워크플로를 수행할 수 있는지 평가하는 960개 전문가 제작 태스크, 55개 디지털 산업 분야를 아우르는 대규모 벤치마크 ALE를 제안한다.
ALE(Agents' Last Exam)는 250명 이상의 산업 전문가와 협력하여 구축된 벤치마크로, O*NET/SOC 2018 직업 분류 체계에 기반해 13개 산업 클러스터, 55개 하위 분야, 1,490개 태스크 인스턴스를 포함한다. 각 태스크는 실제 전문가가 완료한 프로젝트에서 수집되었으며, 다단계 품질 관리를 거쳐 결정론적 스크립트와 구조화된 루브릭으로 자동 평가된다. 실험 결과, 최첨단 에이전트 구성(Codex + GPT-5.5)조차 가장 쉬운 티어에서 50% 미만, 가장 어려운 티어에서 10% 미만의 통과율을 기록하여 현재 AI 시스템의 한계를 명확히 보여준다. ALE는 벤치마크 성공과 GDP 수준 경제적 임팩트 사이의 간극을 좁히기 위한 도구로 설계되었다.
핵심 요약
- O*NET/SOC 2018 직업 분류에 기반한 55개 하위 분야, 13개 산업 클러스터, 1,490개 태스크 인스턴스를 포함하는 대규모 벤치마크다.
- 태스크는 실무 전문가가 이미 완료한 프로젝트에서 수집하며, 결정론적 스크립트와 구조화된 루브릭으로 자동 평가하여 인간 평가자 의존을 제거했다.
- 태스크 난이도에 따라 Near-Term(59개), Full-Spectrum(55개), Last-Exam(36개) 세 티어로 분류하여 다양한 수준의 에이전트 평가를 지원한다.
- 실패 원인 분석 결과, 도메인 지식 부족(understanding/approach)이 전체 실패의 약 75%를 차지하며, 실행 능력보다 지식이 주요 병목임을 보여준다.
- 모델 선택이 에이전트 harness 선택보다 약 3배 더 큰 성능 차이를 만들어내며, 더 많은 리소스 소비가 항상 더 나은 성능으로 이어지지는 않는다.
- 최강 구성(Codex + GPT-5.5)도 평균 통과율 2.6%에 불과하여, 벤치마크가 여전히 포화 상태와 거리가 멀음을 시사한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.