PACE: A Proxy for Agentic Capability Evaluation

발행일
출처
arXiv
논문 번호
563
분야
AI / General
arXiv 번호
2607.02032

비싼 에이전틱 벤치마크(SWE-Bench, GAIA 등) 점수를 저렴한 비-에이전틱 벤치마크 100개 인스턴스만으로 예측하는 프레임워크다. MAE 3.8%, Spearman 0.81, 약 100배 비용 절감을 달성한다.

PACE는 에이전틱 벤치마크 평가 비용 문제를 해결하기 위해, 기존 비-에이전틱 평가 인스턴스 풀에서 각 타겟 벤치마크 점수를 가장 잘 예측하는 100개 인스턴스를 자동 선별하는 프레임워크다. SVD leverage(전역 정보량)와 rank correlation(타겟 관련성)을 결합한 이중 선택 기준과 bootstrap 안정화 회귀를 사용한다. 14개 모델·4개 에이전틱 벤치마크에서 LOOCV MAE 3.80%, Spearman 0.81, pairwise accuracy 84.4%를 달성했으며, 이는 동일 품질의 무작위 타겟 서브샘플링 대비 약 1/100 비용이다. 선별된 인스턴스의 능력 분포는 각 에이전틱 벤치마크가 요구하는 고유 역량 프로파일(GAIA→지시 따라하기·검증, SWE-Bench→계획·코드·검증)을 해석 가능하게 보여준다.

핵심 요약

  • 핵심 아이디어: 비싼 에이전틱 평가를 저렴한 단일 턴 벤치마크 점수로 예측—100개 proxy 인스턴스로 충분
  • 이중 선택: SVD leverage(기하학적 정보량) + rank correlation(타겟 관련성)을 타겟별 가중치로 결합
  • LOOCV 결과: MAE 3.80%, Spearman 0.81, pairwise accuracy 84.4%—14개 모델·4개 타겟 검증
  • 비용 효율: 동일 품질 무작위 샘플링 대비 ~100× 저렴—에이전틱 평가를 일상적 모델 개발 단계에 도입 가능
  • 해석 가능성: 선별 인스턴스의 능력 분포가 각 벤치마크 요구 역량(GAIA=IF+검증, SWT=계획+테스트)을 명확히 반영

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)