Benchmarks in Leipzig

발행일
출처
arXiv
논문 번호
356
분야
AI / General
arXiv 번호
2606.05818

49명의 연구 수학자가 직접 출제한 100개의 연구 수준 수학 문제로 LLM의 수학적 추론 능력을 평가한 결과, 3단계 평가 후 미해결 문제가 41개에서 2개로 줄어 LLM의 능력이 인상적임을 보였다.

2026년 4~5월, 라이프치히 막스 플랑크 수학연구소에서 49명의 수학자가 협업해 대수기하학, 조합론, 표현론 등 다양한 분야의 연구 수준 수학 문제 100개를 구성했다. 3단계 평가에서 Stage 1(5개 모델 단일 시도) 후 41문제 미해결, Stage 2(20회 반복) 후 16문제 미해결, Stage 3(heavy-thinking 모델 3회 시도) 후 단 2문제만 미해결로 떨어졌다. GPT-5.5가 단일 시도에서 44문제를 해결하며 최고 성능을 보였고, 모델 간·실행 간 편차가 매우 크게 나타났다.

핵심 요약

  • 49명 수학자(35명 워크숍 직접 참여)가 출제한 연구 수준 수학 문제 100개, 대수기하·조합론·표현론 등 25개 세부 분야
  • 3단계 평가 파이프라인: Stage 1 (5모델×1회) → Stage 2 (3모델×20회) → Stage 3 (2모델×3회 heavy-thinking)
  • 미해결 문제가 41→16→2로 급감, 연습 스타일 벤치마크는 최고 성능 모델의 한계에 도달했음을 시사
  • GPT-5.5 단일 시도 44문제 해결로 최고 성능, 모델 간 성능 격차가 극심 (Grok 4.3은 6문제만 해결)
  • 동일 모델의 반복 실행 간에도 성능 편차가 매우 크게 나타나, 수학 추론의 결정론적 한계 존재
  • ScienceBench 플랫폼 기반 공개 벤치마크로, LLM 리뷰 과정에서 3개 문제 오류 발견·제거

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)