Benchmarks in Leipzig
- 발행일
- 출처
- arXiv
- 논문 번호
- 356
- 분야
- AI / General
- arXiv 번호
- 2606.05818
49명의 연구 수학자가 직접 출제한 100개의 연구 수준 수학 문제로 LLM의 수학적 추론 능력을 평가한 결과, 3단계 평가 후 미해결 문제가 41개에서 2개로 줄어 LLM의 능력이 인상적임을 보였다.
2026년 4~5월, 라이프치히 막스 플랑크 수학연구소에서 49명의 수학자가 협업해 대수기하학, 조합론, 표현론 등 다양한 분야의 연구 수준 수학 문제 100개를 구성했다. 3단계 평가에서 Stage 1(5개 모델 단일 시도) 후 41문제 미해결, Stage 2(20회 반복) 후 16문제 미해결, Stage 3(heavy-thinking 모델 3회 시도) 후 단 2문제만 미해결로 떨어졌다. GPT-5.5가 단일 시도에서 44문제를 해결하며 최고 성능을 보였고, 모델 간·실행 간 편차가 매우 크게 나타났다.
핵심 요약
- 49명 수학자(35명 워크숍 직접 참여)가 출제한 연구 수준 수학 문제 100개, 대수기하·조합론·표현론 등 25개 세부 분야
- 3단계 평가 파이프라인: Stage 1 (5모델×1회) → Stage 2 (3모델×20회) → Stage 3 (2모델×3회 heavy-thinking)
- 미해결 문제가 41→16→2로 급감, 연습 스타일 벤치마크는 최고 성능 모델의 한계에 도달했음을 시사
- GPT-5.5 단일 시도 44문제 해결로 최고 성능, 모델 간 성능 격차가 극심 (Grok 4.3은 6문제만 해결)
- 동일 모델의 반복 실행 간에도 성능 편차가 매우 크게 나타나, 수학 추론의 결정론적 한계 존재
- ScienceBench 플랫폼 기반 공개 벤치마크로, LLM 리뷰 과정에서 3개 문제 오류 발견·제거
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.