You Don't Need to Run Every Eval

발행일
출처
arXiv
논문 번호
493
분야
Machine Learning
arXiv 번호
2606.24020

84개 프런티어 모델과 133개 벤치마크 점수 매트릭스가 실질적으로 rank-2 구조를 가짐을 보이고 BENCHPRESS를 제안한다.

저자들은 84개 프런티어 모델과 133개 벤치마크의 공개 점수 매트릭스(2,604개 셀, 23.3% 채워짐)를 구축하여 실질적으로 rank-2 구조를 가짐을 보인다. logit 공간의 rank-2 ALS 매트릭스 완성 방법인 BENCHPRESS를 설계하여 숨겨진 점수를 4.6점 이내로 복구한다. 5개 벤치마크 {GPQA-D, HLE, Codeforces, MMLU-Pro, ARC-AGI-1}를 사용하여 모델의 공개 스코어카드를 3.93점 이내로 복구한다.

핵심 요약

  • 저자들은 84개 프런티어 모델과 133개 벤치마크의 공개 점수 매트릭스(2,604개 셀, 23.3% 채워짐)를 구축하여 실질적으로 rank-2 구조를 가짐을 보인다
  • logit 공간의 rank-2 ALS 매트릭스 완성 방법인 BENCHPRESS를 설계하여 숨겨진 점수를 4.6점 이내로 복구한다

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)