You Don't Need to Run Every Eval
- 발행일
- 출처
- arXiv
- 논문 번호
- 493
- 분야
- Machine Learning
- arXiv 번호
- 2606.24020
84개 프런티어 모델과 133개 벤치마크 점수 매트릭스가 실질적으로 rank-2 구조를 가짐을 보이고 BENCHPRESS를 제안한다.
저자들은 84개 프런티어 모델과 133개 벤치마크의 공개 점수 매트릭스(2,604개 셀, 23.3% 채워짐)를 구축하여 실질적으로 rank-2 구조를 가짐을 보인다. logit 공간의 rank-2 ALS 매트릭스 완성 방법인 BENCHPRESS를 설계하여 숨겨진 점수를 4.6점 이내로 복구한다. 5개 벤치마크 {GPQA-D, HLE, Codeforces, MMLU-Pro, ARC-AGI-1}를 사용하여 모델의 공개 스코어카드를 3.93점 이내로 복구한다.
핵심 요약
- 저자들은 84개 프런티어 모델과 133개 벤치마크의 공개 점수 매트릭스(2,604개 셀, 23.3% 채워짐)를 구축하여 실질적으로 rank-2 구조를 가짐을 보인다
- logit 공간의 rank-2 ALS 매트릭스 완성 방법인 BENCHPRESS를 설계하여 숨겨진 점수를 4.6점 이내로 복구한다
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.