Benchmark Everything Everywhere All at Once
- 발행일
- 출처
- arXiv
- 논문 번호
- 340
- 분야
- AI / General
- arXiv 번호
- 2606.06462
에이전트가 자율적으로 벤치마크를 구축하는 시스템으로, 15개 벤치마크를 생성해 품질을 검증받았다.
Benchmark Agent는 사용자 쿼리 분석, 하위태스크 설계, 데이터 주석, 품질 관리까지 벤치마크 구축 전체 파이프라인을 자율적으로 수행하는 에이전트 시스템이다. 기존 벤치마크의 노동 집약적 구축과 빠른 성능 포화 문제를 해결하기 위해 설계되었다. 텍스트 이해, 멀티모달 이해, 도메인 특화 추론 등 15개 대표 벤치마크를 생성하고, 인간 평가와 LLM-as-a-judge로 높은 품질을 검증받았다. 지속적 평가를 통해 현재 모델들이 특정 도메인 추론 태스크에서 어려움을 겪는다는 점 등 여러 통찰을 발견했다.
핵심 요약
- 쿼리 분석부터 품질 관리까지 벤치마크 구축 전체 파이프라인을 자율적으로 수행한다.
- 기존 벤치마크의 노동 집약성과 빠른 성능 포화 문제를 해결한다.
- 텍스트, 멀티모달, 도메인 추론 등 15개 벤치마크를 성공적으로 생성했다.
- 인간 평가와 LLM-as-a-judge로 생성 샘플의 높은 품질을 확인했다.
- 지속적 평가를 통해 현재 모델들의 도메인 특화 추론 약점을 발견했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.