Towards Robust Mathematical Reasoning

발행일
출처
arXiv
논문 번호
092
분야
Math Reasoning / Benchmarks
arXiv 번호
2511.01846

Google DeepMind가 문제 해결, 증명 작성, 증명 채점 과제를 통해 대형 언어 모델의 고급 수학적 추론을 평가하도록 설계된 벤치마크 모음 IMO-Bench를 개발했다.

Google DeepMind가 문제 해결, 증명 작성, 증명 채점 과제를 통해 대형 언어 모델의 고급 수학적 추론을 평가하도록 설계된 벤치마크 모음 IMO-Bench를 개발했다. Gemini Deep Think(IMO Gold) 모델은 강건화된 문제에서 80.0% 정확도를, 까다로운 증명 작성 과제에서 65.7%를 달성했다.

핵심 요약

  • 기존 수학적 추론 벤치마크(예: GSM8K, MATH, AIME)는 포화 상태에 가까워지고 있어, 고급 모델 능력을 변별하는 데 유용성이 제한된다.
  • 현재의 많은 벤치마크는 주로 최종 답 일치에 의존하는데, 이는 모델이 견고한 다단계 추론을 보이지 않은 채 추측하거나 암기하도록 만들 수 있다.
  • 증명을 생성하고 엄밀하게 평가하는 능력처럼 더 깊은 수학적 이해를 평가하기 위한 포괄적인 평가 프레임워크가 부족하다.
  • 강건한 문제 해결을 위한 IMO-AnswerBench, 엄밀한 증명 작성을 위한 IMO-Proof Bench, 증명 평가를 위한 IMO-GradingBench의 세 가지 벤치마크로 구성된 포괄적 모음 IMO-Bench를 도입한다.
  • IMO-AnswerBench는 네 개 범주에 걸친 400개의 올림피아드 문제를 활용하며, 데이터 암기를 방지하기 위한 명시적 '강건화' 기법(패러프레이징, 수치 변경)을 적용한다.
  • IMO-Proof Bench는 기초 및 고급 세트로 나뉜 60개의 IMO 수준 증명 문제를 제공하며, 전통적인 IMO 채점을 본떠 인간 전문가가 0~7점 척도로 주로 평가한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)