AlphaEval: Evaluating Agents in Production
- 발행일
- 출처
- arXiv
- 논문 번호
- 145
- 분야
- Agents / Evaluation / Coding
- arXiv 번호
- 2604.12162
AlphaEval이라는 평가 프레임워크가 실제 운영 환경에서 AI 에이전트를 평가하기 위해 도입되었으며, 최고 성능 에이전트가 실세계 과제에서 100점 만점에 64.41점을 달성했고 에이전트 스캐폴딩이 성능에 지대한 영향을 미친다는 점을 밝혔다.
AlphaEval이라는 평가 프레임워크가 실제 운영 환경에서 AI 에이전트를 평가하기 위해 도입되었으며, 최고 성능 에이전트가 실세계 과제에서 100점 만점에 64.41점을 달성했고 에이전트 스캐폴딩이 성능에 지대한 영향을 미친다는 점을 밝혔다. 이 프레임워크는 운영 특유의 여섯 가지 실패 모드를 식별하고 에이전트가 제공하는 경제적 가치를 정량화했다.
핵심 요약
- AI 에이전트 평가에는 상당한 '연구-운영 격차'가 존재하는데, 현재 벤치마크가 실세계 상업적 배포의 복잡성을 반영하지 못하기 때문이다.
- 전통적인 벤치마크는 명시적으로 정의된 요구사항, 결정론적 지표, 정적 과제에 의존하며, 이는 암묵적 제약, 주관적 판단, 변화하는 요구로 특징지어지는 운영 환경과 대비된다.
- 평가는 흔히 기반 언어 모델에 초점을 맞춰, 완전한 에이전트 제품 또는 스캐폴드가 실세계 성능에 미치는 상당한 영향을 간과한다.
- 활성 상업 배포에서 도출된, 6개 O*NET 직업 영역에 걸쳐 7개 기업에서 수집한 94개 과제를 갖춘 벤치마크 AlphaEval을 도입했다.
- 진정성 있고 명세가 부족한 운영 요구를 실행 가능하고 자동화된 평가 과제로 변환하기 위해 4단계 '요구사항-벤치마크 구축 프레임워크'를 구현했다.
- 다원적 평가 방법론(예: 참조 답안, 형식 논리, 루브릭 기반, 실행 기반)과 LLM-as-a-Judge를 과제별 경제적 가치 주석과 함께 통합했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.