HDATF RESEARCH / 벤치마크 보고서
업무를 끝내는 AI, 어떻게 검증할 것인가
공개 성적에서 읽을 수 있는 것과 직접 실행해 확인해야 할 것. 모델 선택부터 조사, 문서 작성, 결과 검증까지 살펴봅니다.
먼저 읽을 결론
공개 벤치마크는 모델을 고르고 시험을 설계하는 근거입니다. 업무에 쓸 준비가 됐는지는 실제 자료와 도구를 연결한 뒤, 요청한 결과물을 끝까지 만드는지 확인해야 알 수 있습니다.
이 보고서는 쓸 수 있는 결과물, 확인 가능한 근거, 끝까지 이어지는 실행을 기준으로 공개 성적을 읽습니다. HDATF가 이 평가들에서 직접 측정해 공개한 성적은 아직 없습니다. 마지막 장에서는 그 차이를 확인하기 위한 평가 계획을 설명합니다.
73 평가와 지표684 보관된 성적
성적을 읽기 전에, 맡길 일을 정해야 합니다.
벤치마크는 정해진 과제와 채점 기준으로 능력을 비교하는 시험입니다. 추론 문제를 푸는 시험, 문서를 비교하는 시험, 도구로 작업을 수행하는 시험은 확인하는 능력이 다릅니다. 점수를 읽을 때도 무엇을 시험했는지부터 봐야 합니다.
보고서 업무라면 파일이 열리고, 주장의 근거를 찾을 수 있고, 요청한 내용이 들어 있어야 합니다. 데이터 분석이라면 제공한 자료로 결과를 다시 만들 수 있어야 합니다. 일반 모델 순위만으로는 이 조건을 확인할 수 없습니다.
공개 성적은 후보를 좁히고 어떤 실패를 시험할지 정하는 데 씁니다. LabChin에 적용할 방법을 고를 때는 우리 자료와 권한, 도구, 결과 검사 기준을 연결한 과제가 필요합니다. 이 보고서는 결과물, 근거, 실행 방식의 순서로 그 판단 기준을 살펴봅니다.[1]
결과물은 요청한 업무를 기준으로 읽어야 합니다.
GDPval은 전문 업무의 산출물을 비교합니다. 최초 Gold 연구에서는 44개 직종의 과제 220개를 다뤘습니다. 전문가는 작성자를 모르는 상태에서 결과물을 비교했습니다. 아래 그림은 그 연구에서 보관한 세 결과입니다.
승리와 동률 비율은 해당 산출물 비교의 결과입니다. 회사 업무를 AI에 맡길 수 있는 비율로 바꿔 읽어서는 안 됩니다. 과제의 범위와 전문가 판단, 사용한 모델 구성이 해석의 범위를 정합니다.[2]
GDPval Gold
전문가 산출물 대비 승리와 동률 비율 (%)
- Claude Opus 4.147.6%
- GPT-5 (high)38.8%
- o3 (high)34.1%
44개 직종의 Gold 과제 220개. 전문가가 작성자를 가린 채 산출물을 비교한 최초 연구 결과입니다. 현재 모델 순위가 아닙니다.
HDATF가 확인할 것은 파일을 만든 뒤 사람이 얼마나 더 일해야 하는가입니다. 빠진 요구사항, 근거 없는 수치, 사람이 고친 내용을 함께 남겨야 합니다. 읽기 좋은 배치는 품질의 한 부분입니다. 잘못된 근거나 쓸 수 없는 파일을 대신해 주지는 못합니다.
답을 찾는 능력과 근거로 설명하는 능력을 함께 봅니다.
BrowseComp는 찾기 어려운 사실을 알아내는 능력을 시험합니다. Parallel의 공개 비교는 전체 1,266문항 중 무작위 100문항을 사용했습니다. 정답률과 요청 비용을 함께 발표했습니다. 아래 결과는 제공사가 일부 문항으로 수행한 실험입니다.[3][4]
BrowseComp / Parallel study
정답률 (%)
전체 1,266문항 중 무작위 100문항. Parallel이 2025년 8월 11일부터 29일까지 측정했습니다. 요청당 비용은 Ultra8x 2.40달러, Ultra 0.30달러, GPT-5 0.488달러입니다. 구성과 예산이 다릅니다.
Ultra8x는 요청당 2.40달러에서 정답률 58%, Ultra는 0.30달러에서 45%를 보고했습니다. 투입한 예산이 다릅니다. 정확도와 비용을 함께 볼 수 있지만, 같은 비용에서의 우열이나 기반 모델 하나의 효과를 증명하지는 않습니다.
조사 보고서는 더 확인할 것이 있습니다. DeepResearch Bench II와 ResearchRubrics는 명시한 기준으로 보고서 내용을 평가합니다. LabChin에서는 주요 주장에 쓰인 원문 구절, 상충하는 자료, 답하지 못한 질문을 함께 남기는 방식으로 검증하려고 합니다.
같은 모델도 실행 방식에 따라 결과가 달라집니다.
하네스는 모델에 도구와 참고 자료를 주고 작업 순서를 제어하는 실행 소프트웨어입니다. LangChain은 GPT-5.2-Codex 모델을 유지한 채 이 실행 방식을 바꿨습니다. 89개 과제의 Terminal-Bench 2.0 성적은 52.8%에서 66.5%로 달라졌습니다.[5][6]
Terminal-Bench 2.0
과제 성공률 (%)
89개 과제. GPT-5.2-Codex 모델을 유지하고 프롬프트, 도구, 실행 제어를 바꾼 LangChain의 실험입니다. Harbor와 Daytona에서 실행했습니다. 발표된 차이는 13.7%p입니다.
실험에서는 지시문, 도구, 실행 제어를 함께 바꿨습니다. 종료 전 검사와 실행 환경 안내도 포함됐습니다. 13.7%p 차이는 이 변경을 묶어 시험한 결과입니다. 개별 기능의 기여도나 HDATF에서 얻을 개선 폭은 이 수치로 정할 수 없습니다.
우리 업무에서는 과제와 모델을 고정하고 결과 검사 유무를 비교할 수 있습니다. 만든 파일과 검사 결과, 재시도, 소요 시간을 함께 남기는 방식입니다. 성공한 과제뿐 아니라 사람이 개입해야 했던 실패까지 설명해야 실행 방식의 차이를 판단할 수 있습니다.
메모리는 별도로 시험해야 합니다. 과거 정보를 떠올리더라도 수정된 내용과 접근 범위를 제대로 처리해야 업무에서 쓸 수 있습니다. 보관한 LoCoMo 성적은 단일 사실 회상에 한정됩니다. 변경 충돌과 사용자 간 분리를 검증한 결과로 읽지 않고, 부록의 참고 자료로 남겼습니다.
이제 확인할 것은 HDATF가 수행한 실제 업무입니다.
공개 연구로 필요한 질문은 정리할 수 있습니다. 우리 제품의 성적은 직접 측정해야 합니다. 대표 과제로 실행 조건을 기록한 비교를 진행하고, 근거 탐색과 분석, 결과물 완수를 각각 확인할 계획입니다. 한 부분의 높은 점수가 다른 부분의 실패를 가리지 않게 하려는 것입니다.
조사와 데이터 작업에서는 질문, 사용한 자료의 판본, 최종 결과 검사 기록을 남깁니다. 보고서는 근거 없는 주장을 찾을 수 있어야 합니다. 분석은 입력 데이터와 실행 기록, 재현할 결과물을 보존해야 합니다. 아래 기준은 앞으로 확인할 내용이며 완료한 시험은 아닙니다.[1][7][8][9]
평가 계획입니다. HDATF 실측 성적은 아직 공개하지 않았습니다.
필요한 근거를 찾는가
BrowseComp는 웹에서 찾기 어려운 사실을 찾아내는지 평가합니다. LabChin에서는 찾은 출처가 실제로 그 주장을 뒷받침하는지도 별도로 확인하려고 합니다.
근거로 질문에 답하는가
DeepResearch Bench II와 ResearchRubrics를 조사 보고서의 평가 기준으로 삼습니다. 문장이 자연스러운지에 그치지 않고, 필요한 내용과 사실 근거, 결론에 이르는 분석을 확인할 계획입니다.
실제로 쓸 결과물을 만드는가
GDPval과 Agents’ Last Exam은 전문 업무를 다룹니다. 요청한 일이 끝났는지, 파일을 실제로 사용할 수 있는지, 사람이 얼마나 고쳐야 하는지 확인할 계획입니다.
| 평가 대상 | 남길 근거 | 확인할 판단 |
|---|---|---|
| 과제 | 요청 내용, 입력 파일, 완료 기준 | 요청한 일이 끝났는가 |
| 실행 | 모델, 도구, 권한, 실행 구성 판본 | 같은 조건으로 다시 실행할 수 있는가 |
| 결과 | 결과 파일, 출처 검사, 사람의 수정 내용 | 결과물을 실제로 쓸 수 있는가 |
| 효율 | 전체 시간, 도구 사용, 재시도, 총비용 | 업무 전체의 시간과 비용을 감당할 수 있는가 |
부록. 전체 평가 자료
평가별 공개 성적을 비교합니다. 모델 이름을 누르면 원문을 볼 수 있습니다. 표기된 날짜 기준이며, 모델군 비교에는 각 모델군의 최고 성적 구성을 표시했습니다.
73 / 73 평가와 지표
업무와 문서
AA-Briefcase15 개 성적
장기 사무 업무 수행
- Claude Fable 5.11,661.91
- Claude Opus 51,647.02
- GPT-6 Astra1,561.95
- Muse Spark 1.31,558.85
- Grok 4.61,545.82
- Claude Fable 51,533.52
- GLM-5.31,515.45
- Kimi K31,496.83
- GPT-5.6 Sol1,474.49
- GLM 5.3 Flash1,459.13
- Qwen3.8 2.4T A95B1,442.81
- DeepSeek V4 Flash 07311,433.23
- Qwen3.8 27B1,401.81
- Qwen3.8 Max1,392.33
- Claude Sonnet 51,358.11
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 1,661.91 | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 1,647.02 | 원본 기록 |
| GPT-6 Astra (max)OpenAI | 1,561.95 | 원본 기록 |
| Muse Spark 1.3 (max)Meta | 1,558.85 | 원본 기록 |
| Grok 4.6 (xhigh)SpaceXAI | 1,545.82 | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 1,533.52 | 원본 기록 |
| GLM-5.3 (max)Z AI | 1,515.45 | 원본 기록 |
| Kimi K3 (max)Kimi | 1,496.83 | 원본 기록 |
| GPT-5.6 Sol (max)OpenAI | 1,474.49 | 원본 기록 |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 1,459.13 | 원본 기록 |
| Qwen3.8 2.4T A95BAlibaba | 1,442.81 | 원본 기록 |
| DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek | 1,433.23 | 원본 기록 |
| Qwen3.8 27B (xhigh)Alibaba | 1,401.81 | 원본 기록 |
| Qwen3.8 MaxAlibaba | 1,392.33 | 원본 기록 |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 1,358.11 | 원본 기록 |
AA-Briefcase / Rubric15 개 성적
업무 요구사항 충족
- Claude Fable 5.161.52%
- Claude Opus 557.98%
- Claude Fable 555.96%
- Muse Spark 1.354.87%
- Grok 4.653.84%
- GPT-6 Astra52.32%
- GLM-5.351.35%
- Kimi K350.97%
- Qwen3.8 2.4T A95B50%
- Qwen3.8 Max49.6%
- Qwen3.8 27B47.8%
- GLM 5.3 Flash46.36%
- DeepSeek V4 Flash 073146.15%
- Muse Spark 1.245.15%
- DeepSeek V4 Pro 081343.52%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 61.52% | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic | 57.98% | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 55.96% | 원본 기록 |
| Muse Spark 1.3 (max)Meta | 54.87% | 원본 기록 |
| Grok 4.6 (xhigh)SpaceXAI | 53.84% | 원본 기록 |
| GPT-6 Astra (xhigh)OpenAI | 52.32% | 원본 기록 |
| GLM-5.3 (max)Z AI | 51.35% | 원본 기록 |
| Kimi K3 (max)Kimi | 50.97% | 원본 기록 |
| Qwen3.8 2.4T A95BAlibaba | 50% | 원본 기록 |
| Qwen3.8 MaxAlibaba | 49.6% | 원본 기록 |
| Qwen3.8 27B (xhigh)Alibaba | 47.8% | 원본 기록 |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 46.36% | 원본 기록 |
| DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek | 46.15% | 원본 기록 |
| Muse Spark 1.2 (xhigh)Meta | 45.15% | 원본 기록 |
| DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek | 43.52% | 원본 기록 |
AA-Briefcase / Analytical quality15 개 성적
분석 내용의 품질
- Claude Fable 5.11,959.49
- Claude Opus 51,909.74
- GLM-5.31,788.62
- GPT-6 Astra1,753.64
- Muse Spark 1.31,711.52
- Grok 4.61,682.58
- Claude Fable 51,676.55
- Kimi K31,668.89
- GLM 5.3 Flash1,650.95
- Qwen3.8 2.4T A95B1,617.45
- DeepSeek V4 Flash 07311,617.37
- Qwen3.8 27B1,590.24
- GPT-5.6 Sol1,537.92
- Qwen3.8 Max1,533.14
- Claude Sonnet 51,418.22
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 1,959.49 | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 1,909.74 | 원본 기록 |
| GLM-5.3 (max)Z AI | 1,788.62 | 원본 기록 |
| GPT-6 Astra (max)OpenAI | 1,753.64 | 원본 기록 |
| Muse Spark 1.3 (max)Meta | 1,711.52 | 원본 기록 |
| Grok 4.6 (xhigh)SpaceXAI | 1,682.58 | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 1,676.55 | 원본 기록 |
| Kimi K3 (max)Kimi | 1,668.89 | 원본 기록 |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 1,650.95 | 원본 기록 |
| Qwen3.8 2.4T A95BAlibaba | 1,617.45 | 원본 기록 |
| DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek | 1,617.37 | 원본 기록 |
| Qwen3.8 27B (xhigh)Alibaba | 1,590.24 | 원본 기록 |
| GPT-5.6 Sol (max)OpenAI | 1,537.92 | 원본 기록 |
| Qwen3.8 MaxAlibaba | 1,533.14 | 원본 기록 |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 1,418.22 | 원본 기록 |
AA-Briefcase / Presentation15 개 성적
산출물 표현 품질
- GPT-5.6 Sol1,633.93
- Claude Opus 51,544.01
- GPT-6 Astra1,535.29
- GPT-5.6 Terra1,519.13
- Grok 4.61,514.68
- Muse Spark 1.31,506.83
- Claude Fable 5.11,472.7
- GPT-5.6 Luna1,471.03
- Claude Fable 51,456.83
- Kimi K31,435.29
- Claude Sonnet 51,409.5
- GLM 5.3 Flash1,409.12
- DeepSeek V4 Flash 07311,355.99
- GLM-5.31,354.5
- Muse Spark 1.21,334.35
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| GPT-5.6 Sol (max)OpenAI | 1,633.93 | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 1,544.01 | 원본 기록 |
| GPT-6 Astra (max)OpenAI | 1,535.29 | 원본 기록 |
| GPT-5.6 Terra (max)OpenAI | 1,519.13 | 원본 기록 |
| Grok 4.6 (xhigh)SpaceXAI | 1,514.68 | 원본 기록 |
| Muse Spark 1.3 (max)Meta | 1,506.83 | 원본 기록 |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 1,472.7 | 원본 기록 |
| GPT-5.6 Luna (max)OpenAI | 1,471.03 | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 1,456.83 | 원본 기록 |
| Kimi K3 (max)Kimi | 1,435.29 | 원본 기록 |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 1,409.5 | 원본 기록 |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 1,409.12 | 원본 기록 |
| DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek | 1,355.99 | 원본 기록 |
| GLM-5.3 (max)Z AI | 1,354.5 | 원본 기록 |
| Muse Spark 1.2 (xhigh)Meta | 1,334.35 | 원본 기록 |
GDPval-AA v215 개 성적
실제 직무 과제 수행
- Claude Fable 5.11,765.9
- Claude Opus 51,738.08
- Muse Spark 1.31,719.65
- GLM-5.31,678.47
- GLM 5.3 Flash1,672.94
- Grok 4.61,664.82
- Qwen3.8-Flash-Next1,649.93
- Claude Fable 51,635.39
- Qwen3.8 Max1,633.53
- Qwen3.8 2.4T A95B1,630.39
- GPT-5.6 Sol1,625.68
- Kimi K31,585.72
- GPT-6 Astra1,582.24
- DeepSeek V4 Flash 07311,579.3
- Muse Spark 1.21,525.03
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 1,765.9 | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 1,738.08 | 원본 기록 |
| Muse Spark 1.3 (max)Meta | 1,719.65 | 원본 기록 |
| GLM-5.3 (max)Z AI | 1,678.47 | 원본 기록 |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 1,672.94 | 원본 기록 |
| Grok 4.6 (xhigh)SpaceXAI | 1,664.82 | 원본 기록 |
| Qwen3.8-Flash-NextAlibaba | 1,649.93 | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 1,635.39 | 원본 기록 |
| Qwen3.8 MaxAlibaba | 1,633.53 | 원본 기록 |
| Qwen3.8 2.4T A95BAlibaba | 1,630.39 | 원본 기록 |
| GPT-5.6 Sol (max)OpenAI | 1,625.68 | 원본 기록 |
| Kimi K3 (max)Kimi | 1,585.72 | 원본 기록 |
| GPT-6 Astra (max)OpenAI | 1,582.24 | 원본 기록 |
| DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek | 1,579.3 | 원본 기록 |
| Muse Spark 1.2 (xhigh)Meta | 1,525.03 | 원본 기록 |
AA-AnalystAgent / pass^515 개 성적
스프레드시트와 문서 분석의 반복 성공
- Gemini 3.7 Flash60%
- Claude Fable 5.157.5%
- Claude Opus 553.75%
- GPT-6 Astra51.25%
- Claude Fable 548.75%
- GPT-5.6 Sol47.5%
- Claude Sonnet 546.25%
- Gemini 3.1 Pro Preview41.25%
- Grok 4.641.25%
- Kimi K338.75%
- Grok 4.535%
- Inkling Small27.5%
- Inkling23.75%
- MiMo-V2.5-Pro20%
- DeepSeek V4 Pro 042418.75%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Gemini 3.7 Flash (high)Google | 60% | 원본 기록 |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 57.5% | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 53.75% | 원본 기록 |
| GPT-6 Astra (max)OpenAI | 51.25% | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 48.75% | 원본 기록 |
| GPT-5.6 Sol (max)OpenAI | 47.5% | 원본 기록 |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 46.25% | 원본 기록 |
| Gemini 3.1 Pro PreviewGoogle | 41.25% | 원본 기록 |
| Grok 4.6 (high)SpaceXAI | 41.25% | 원본 기록 |
| Kimi K3 (max)Kimi | 38.75% | 원본 기록 |
| Grok 4.5 (high)SpaceXAI | 35% | 원본 기록 |
| Inkling SmallThinking Machines | 27.5% | 원본 기록 |
| Inkling (xhigh)Thinking Machines | 23.75% | 원본 기록 |
| MiMo-V2.5-ProXiaomi | 20% | 원본 기록 |
| DeepSeek V4 Pro 0424 (DeepSeek V4 Pro (Reasoning, Max Effort))DeepSeek | 18.75% | 원본 기록 |
GDP.pdf / All-pass15 개 성적
업무 문서를 읽고 추론
- GPT-6 Astra33.2%
- GPT-5.6 Sol28.2%
- Claude Fable 5.128%
- Muse Spark 1.325.6%
- GPT-5.6 Terra25.6%
- Claude Fable 524%
- GPT-5.6 Luna23.8%
- Gemini 3.7 Flash23.6%
- Gemini 3.8 Flash22.8%
- Qwen3.8 Max21.8%
- Claude Opus 521.6%
- GPT-5.5 Instant (June 2026)20.2%
- Kimi K319.6%
- Grok 4.518.8%
- Grok 4.618.8%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| GPT-6 Astra (max)OpenAI | 33.2% | 원본 기록 |
| GPT-5.6 Sol (max)OpenAI | 28.2% | 원본 기록 |
| Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)Anthropic | 28% | 원본 기록 |
| Muse Spark 1.3 (max)Meta | 25.6% | 원본 기록 |
| GPT-5.6 Terra (max)OpenAI | 25.6% | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 24% | 원본 기록 |
| GPT-5.6 Luna (xhigh)OpenAI | 23.8% | 원본 기록 |
| Gemini 3.7 Flash (high)Google | 23.6% | 원본 기록 |
| Gemini 3.8 Flash (medium)Google | 22.8% | 원본 기록 |
| Qwen3.8 MaxAlibaba | 21.8% | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 21.6% | 원본 기록 |
| GPT-5.5 Instant (June 2026)OpenAI | 20.2% | 원본 기록 |
| Kimi K3 (max)Kimi | 19.6% | 원본 기록 |
| Grok 4.5 (high)SpaceXAI | 18.8% | 원본 기록 |
| Grok 4.6 (high)SpaceXAI | 18.8% | 원본 기록 |
AutomationBench-AA15 개 성적
업무 앱에서 목표 달성
- Gemini 3.7 Flash62.75%
- Kimi K352.71%
- Grok 4.551.44%
- GPT-5.6 Sol51.19%
- Gemini 3.6 Flash51.08%
- Gemini 3.8 Flash50.72%
- Claude Fable 548.58%
- GPT-5.6 Terra45.61%
- GPT-5.6 Luna42.24%
- Claude Sonnet 539.19%
- Gemini 3.1 Pro Preview37.54%
- Gemini 3.5 Flash-Lite32.66%
- GLM-5.227.84%
- Kimi K2.7 Code22.53%
- Qwen3.7 Plus20.43%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Gemini 3.7 Flash (high)Google | 62.75% | 원본 기록 |
| Kimi K3 (max)Kimi | 52.71% | 원본 기록 |
| Grok 4.5 (high)SpaceXAI | 51.44% | 원본 기록 |
| GPT-5.6 Sol (max)OpenAI | 51.19% | 원본 기록 |
| Gemini 3.6 Flash (high)Google | 51.08% | 원본 기록 |
| Gemini 3.8 Flash (high)Google | 50.72% | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 48.58% | 원본 기록 |
| GPT-5.6 Terra (max)OpenAI | 45.61% | 원본 기록 |
| GPT-5.6 Luna (max)OpenAI | 42.24% | 원본 기록 |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 39.19% | 원본 기록 |
| Gemini 3.1 Pro PreviewGoogle | 37.54% | 원본 기록 |
| Gemini 3.5 Flash-LiteGoogle | 32.66% | 원본 기록 |
| GLM-5.2 (max)Z AI | 27.84% | 원본 기록 |
| Kimi K2.7 CodeKimi | 22.53% | 원본 기록 |
| Qwen3.7 PlusAlibaba | 20.43% | 원본 기록 |
EnterpriseOps-Gym-AA15 개 성적
기업 운영 업무 수행
- Claude Fable 551.12%
- Gemini 3.7 Flash50.4%
- DeepSeek V4 Pro 081349.6%
- Grok 4.648.34%
- Claude Opus 547.48%
- Qwen3.8 2.4T A95B47.36%
- Muse Spark 1.247.27%
- DeepSeek V4 Flash 073147.09%
- Kimi K345.33%
- Claude Sonnet 544.67%
- Qwen3.8 27B44.23%
- GPT-5.6 Sol42.91%
- GLM-5.242.73%
- Inkling Small42.7%
- Gemini 3.5 Flash-Lite42.35%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 51.12% | 원본 기록 |
| Gemini 3.7 Flash (medium)Google | 50.4% | 원본 기록 |
| DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek | 49.6% | 원본 기록 |
| Grok 4.6 (high)SpaceXAI | 48.34% | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 47.48% | 원본 기록 |
| Qwen3.8 2.4T A95BAlibaba | 47.36% | 원본 기록 |
| Muse Spark 1.2 (xhigh)Meta | 47.27% | 원본 기록 |
| DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek | 47.09% | 원본 기록 |
| Kimi K3 (max)Kimi | 45.33% | 원본 기록 |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 44.67% | 원본 기록 |
| Qwen3.8 27B (xhigh)Alibaba | 44.23% | 원본 기록 |
| GPT-5.6 Sol (max)OpenAI | 42.91% | 원본 기록 |
| GLM-5.2 (max)Z AI | 42.73% | 원본 기록 |
| Inkling SmallThinking Machines | 42.7% | 원본 기록 |
| Gemini 3.5 Flash-LiteGoogle | 42.35% | 원본 기록 |
Harvey LAB-AA15 개 성적
법률 업무 평가 기준 충족
- Muse Spark 1.395.48%
- Kimi K394.64%
- Claude Fable 593.56%
- Claude Opus 593.46%
- Claude Fable 5.193.27%
- Grok 4.592.42%
- GLM-5.290.97%
- Gemini 3.7 Flash90.66%
- Claude Sonnet 590.07%
- MiniMax-M388.41%
- GPT-5.6 Luna87.9%
- GPT-5.6 Sol87.18%
- GPT-5.6 Terra85.18%
- Gemini 3.6 Flash85.15%
- Kimi K2.7 Code85.02%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Muse Spark 1.3 (xhigh)Meta | 95.48% | 원본 기록 |
| Kimi K3 (max)Kimi | 94.64% | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 93.56% | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 93.46% | 원본 기록 |
| Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropic | 93.27% | 원본 기록 |
| Grok 4.5 (high)SpaceXAI | 92.42% | 원본 기록 |
| GLM-5.2 (max)Z AI | 90.97% | 원본 기록 |
| Gemini 3.7 Flash (high)Google | 90.66% | 원본 기록 |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 90.07% | 원본 기록 |
| MiniMax-M3MiniMax | 88.41% | 원본 기록 |
| GPT-5.6 Luna (max)OpenAI | 87.9% | 원본 기록 |
| GPT-5.6 Sol (max)OpenAI | 87.18% | 원본 기록 |
| GPT-5.6 Terra (max)OpenAI | 85.18% | 원본 기록 |
| Gemini 3.6 Flash (high)Google | 85.15% | 원본 기록 |
| Kimi K2.7 CodeKimi | 85.02% | 원본 기록 |
APEX-Agents-AA14 개 성적
여러 앱을 쓰는 장기 업무
- Kimi K341.3%
- GPT-5.6 Terra38.94%
- GPT-5.6 Luna35.84%
- GLM-5.233.7%
- Gemini 3.1 Pro Preview32.01%
- Apodex 1.131.19%
- DeepSeek V4 Pro 042424.26%
- Qwen3.7 Plus22.42%
- Qwen3.5 397B A17B15.34%
- Step 3.7 Flash14.82%
- gpt-oss-120b3.1%
- MiMo-V2.5-Pro2.43%
- Nemotron 3 Super 120B A12B1.84%
- gpt-oss-20b0.74%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Kimi K3 (max)Kimi | 41.3% | 원본 기록 |
| GPT-5.6 Terra (max)OpenAI | 38.94% | 원본 기록 |
| GPT-5.6 Luna (max)OpenAI | 35.84% | 원본 기록 |
| GLM-5.2 (max)Z AI | 33.7% | 원본 기록 |
| Gemini 3.1 Pro PreviewGoogle | 32.01% | 원본 기록 |
| Apodex 1.1Apodex | 31.19% | 원본 기록 |
| DeepSeek V4 Pro 0424 (DeepSeek V4 Pro (Reasoning, Max Effort))DeepSeek | 24.26% | 원본 기록 |
| Qwen3.7 PlusAlibaba | 22.42% | 원본 기록 |
| Qwen3.5 397B A17B (Reasoning)Alibaba | 15.34% | 원본 기록 |
| Step 3.7 FlashStepFun | 14.82% | 원본 기록 |
| gpt-oss-120b (high)OpenAI | 3.1% | 원본 기록 |
| MiMo-V2.5-ProXiaomi | 2.43% | 원본 기록 |
| Nemotron 3 Super 120B A12B (Reasoning)NVIDIA | 1.84% | 원본 기록 |
| gpt-oss-20b (high)OpenAI | 0.74% | 원본 기록 |
시스템 연구
GDPval Gold3 개 성적
전문가가 받아들일 수 있는 업무 산출물을 만드는가? 전문가 산출물 대비 승리와 동률 비율 (%)
- Claude Opus 4.147.6%
- GPT-5 (high)38.8%
- o3 (high)34.1%
BrowseComp / Parallel study3 개 성적
찾기 어려운 정보를 탐색하고 근거를 연결하는가? 정답률 (%)
Terminal-Bench 2.02 개 성적
실행 방식을 바꾸면 작업 결과가 얼마나 달라지는가? 과제 성공률 (%)
에이전트와 도구
τ³-Banking15 개 성적
은행 규정 검색과 도구 실행
- Muse Spark 1.352.37%
- Qwen3.8 Max51.34%
- Grok 4.650.72%
- GLM-5.350.31%
- Qwen3.8 2.4T A95B49.07%
- Qwen3.8 27B48.04%
- GLM 5.3 Flash47.22%
- Claude Fable 5.147.22%
- Kimi K345.98%
- Gemini 3.8 Flash45.77%
- Qwen3.8-Flash-Next45.36%
- Claude Opus 544.74%
- GPT-5.6 Sol44.33%
- GPT-6 Astra43.09%
- Grok 4.542.06%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Muse Spark 1.3 (max)Meta | 52.37% | 원본 기록 |
| Qwen3.8 MaxAlibaba | 51.34% | 원본 기록 |
| Grok 4.6 (high)SpaceXAI | 50.72% | 원본 기록 |
| GLM-5.3 (max)Z AI | 50.31% | 원본 기록 |
| Qwen3.8 2.4T A95BAlibaba | 49.07% | 원본 기록 |
| Qwen3.8 27B (xhigh)Alibaba | 48.04% | 원본 기록 |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 47.22% | 원본 기록 |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 47.22% | 원본 기록 |
| Kimi K3 (max)Kimi | 45.98% | 원본 기록 |
| Gemini 3.8 Flash (medium)Google | 45.77% | 원본 기록 |
| Qwen3.8-Flash-NextAlibaba | 45.36% | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic | 44.74% | 원본 기록 |
| GPT-5.6 Sol (max)OpenAI | 44.33% | 원본 기록 |
| GPT-6 Astra (xhigh)OpenAI | 43.09% | 원본 기록 |
| Grok 4.5 (high)SpaceXAI | 42.06% | 원본 기록 |
τ²-Bench15 개 성적
대화 중 도구 사용
- JT-35B-Flash99.12%
- GLM-5.299.12%
- Step 3.7 Flash98.54%
- Claude Fable 598.54%
- DeepSeek V4 Pro 042496.2%
- Qwen3.5 397B A17B95.61%
- Gemini 3.5 Flash95.61%
- Gemini 3.1 Pro Preview95.61%
- Qwen3.6 35B A3B95.32%
- DeepSeek V4 Flash 042094.44%
- MiMo-V2.5-Pro94.15%
- Qwen3.6 27B94.15%
- Mistral Medium 3.594.15%
- Qwen3.5 122B A10B93.57%
- MiMo-V2-Flash (Feb 2026)93.27%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| JT-35B-FlashChina Mobile | 99.12% | 원본 기록 |
| GLM-5.2 (max)Z AI | 99.12% | 원본 기록 |
| Step 3.7 FlashStepFun | 98.54% | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 98.54% | 원본 기록 |
| DeepSeek V4 Pro 0424 (DeepSeek V4 Pro (Reasoning, Max Effort))DeepSeek | 96.2% | 원본 기록 |
| Qwen3.5 397B A17B (Reasoning)Alibaba | 95.61% | 원본 기록 |
| Gemini 3.5 Flash (medium)Google | 95.61% | 원본 기록 |
| Gemini 3.1 Pro PreviewGoogle | 95.61% | 원본 기록 |
| Qwen3.6 35B A3B (Reasoning)Alibaba | 95.32% | 원본 기록 |
| DeepSeek V4 Flash 0420 (DeepSeek V4 Flash (Non-reasoning))DeepSeek | 94.44% | 원본 기록 |
| MiMo-V2.5-ProXiaomi | 94.15% | 원본 기록 |
| Qwen3.6 27B (Reasoning)Alibaba | 94.15% | 원본 기록 |
| Mistral Medium 3.5Mistral | 94.15% | 원본 기록 |
| Qwen3.5 122B A10B (Reasoning)Alibaba | 93.57% | 원본 기록 |
| MiMo-V2-Flash (Feb 2026)Xiaomi | 93.27% | 원본 기록 |
ITBench-AA15 개 성적
운영 장애 원인 분석
- GPT-5.6 Sol56.21%
- GPT-5.6 Terra51.04%
- Kimi K347.69%
- GLM-5.242.66%
- GPT-5.6 Luna40.32%
- DeepSeek V4 Pro 042438.32%
- MiMo-V2.5-Pro38.23%
- Gemma 4 31B37.29%
- Qwen3.5 397B A17B34.09%
- Gemini 3.1 Pro Preview30.33%
- Step 3.7 Flash30.27%
- Claude 4.5 Haiku27.31%
- Gemma 4 26B A4B23.63%
- gpt-oss-120b5.65%
- Nemotron 3 Super 120B A12B1.13%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| GPT-5.6 Sol (max)OpenAI | 56.21% | 원본 기록 |
| GPT-5.6 Terra (max)OpenAI | 51.04% | 원본 기록 |
| Kimi K3 (max)Kimi | 47.69% | 원본 기록 |
| GLM-5.2 (max)Z AI | 42.66% | 원본 기록 |
| GPT-5.6 Luna (max)OpenAI | 40.32% | 원본 기록 |
| DeepSeek V4 Pro 0424 (DeepSeek V4 Pro (Reasoning, Max Effort))DeepSeek | 38.32% | 원본 기록 |
| MiMo-V2.5-ProXiaomi | 38.23% | 원본 기록 |
| Gemma 4 31B (Reasoning)Google | 37.29% | 원본 기록 |
| Qwen3.5 397B A17B (Reasoning)Alibaba | 34.09% | 원본 기록 |
| Gemini 3.1 Pro PreviewGoogle | 30.33% | 원본 기록 |
| Step 3.7 FlashStepFun | 30.27% | 원본 기록 |
| Claude 4.5 Haiku (Reasoning)Anthropic | 27.31% | 원본 기록 |
| Gemma 4 26B A4B (Reasoning)Google | 23.63% | 원본 기록 |
| gpt-oss-120b (high)OpenAI | 5.65% | 원본 기록 |
| Nemotron 3 Super 120B A12B (Reasoning)NVIDIA | 1.13% | 원본 기록 |
MCP-Atlas public set / Z.ai report7 개 성적
연결된 도구로 과제 완료.
- GPT-5.268%
- GLM-567.8%
- Gemini 3 Pro66.6%
- Claude Opus 4.565.2%
- Kimi K2.563.8%
- DeepSeek V3.262.2%
- GLM-4.752%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| GPT-5.2 (xhigh)OpenAI | 68% | 원본 기록 |
| GLM-5 release reportZ.ai | 67.8% | 원본 기록 |
| Gemini 3 Pro (GLM-5 release comparison)Google | 66.6% | 원본 기록 |
| Claude Opus 4.5 (GLM-5 release comparison)Anthropic | 65.2% | 원본 기록 |
| Kimi K2.5 (GLM-5 release comparison)Moonshot AI | 63.8% | 원본 기록 |
| DeepSeek V3.2 (GLM-5 release comparison)DeepSeek | 62.2% | 원본 기록 |
| GLM-4.7 (GLM-5 release comparison)Z.ai | 52% | 원본 기록 |
코드와 실행
Terminal-Bench v2.115 개 성적
터미널 작업 완료
- Claude Fable 5.191.39%
- GPT-6 Astra89.89%
- GPT-5.6 Sol89.51%
- Claude Opus 589.14%
- Grok 4.688.39%
- GPT-5.6 Terra88.01%
- Gemini 3.8 Flash87.64%
- Qwen3.8-Flash-Next86.14%
- Muse Spark 1.385.77%
- Gemini 3.7 Flash85.77%
- Kimi K385.02%
- Claude Fable 584.64%
- GLM 5.3 Flash84.27%
- GLM-5.383.9%
- Qwen3.8 2.4T A95B82.02%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 91.39% | 원본 기록 |
| GPT-6 Astra (high)OpenAI | 89.89% | 원본 기록 |
| GPT-5.6 Sol (xhigh)OpenAI | 89.51% | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 89.14% | 원본 기록 |
| Grok 4.6 (high)SpaceXAI | 88.39% | 원본 기록 |
| GPT-5.6 Terra (max)OpenAI | 88.01% | 원본 기록 |
| Gemini 3.8 Flash (high)Google | 87.64% | 원본 기록 |
| Qwen3.8-Flash-NextAlibaba | 86.14% | 원본 기록 |
| Muse Spark 1.3 (max)Meta | 85.77% | 원본 기록 |
| Gemini 3.7 Flash (high)Google | 85.77% | 원본 기록 |
| Kimi K3 (max)Kimi | 85.02% | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 84.64% | 원본 기록 |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 84.27% | 원본 기록 |
| GLM-5.3 (max)Z AI | 83.9% | 원본 기록 |
| Qwen3.8 2.4T A95BAlibaba | 82.02% | 원본 기록 |
SciCode15 개 성적
과학 문제를 코드로 해결
- Claude Fable 5.163.08%
- Claude Fable 561%
- Gemini 3.7 Flash59.84%
- Muse Spark 1.359.72%
- Kimi K359.49%
- GLM-5.359.03%
- Gemini 3.1 Pro Preview58.68%
- GPT-5.6 Sol57.75%
- Muse Spark 1.257.41%
- Gemini 3.8 Flash56.6%
- GPT-6 Astra56.48%
- Grok 4.656.48%
- Claude Opus 556.37%
- Grok 4.554.98%
- GPT-5.6 Terra54.98%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 63.08% | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 61% | 원본 기록 |
| Gemini 3.7 Flash (medium)Google | 59.84% | 원본 기록 |
| Muse Spark 1.3 (xhigh)Meta | 59.72% | 원본 기록 |
| Kimi K3 (max)Kimi | 59.49% | 원본 기록 |
| GLM-5.3 (max)Z AI | 59.03% | 원본 기록 |
| Gemini 3.1 Pro PreviewGoogle | 58.68% | 원본 기록 |
| GPT-5.6 Sol (high)OpenAI | 57.75% | 원본 기록 |
| Muse Spark 1.2 (xhigh)Meta | 57.41% | 원본 기록 |
| Gemini 3.8 Flash (high)Google | 56.6% | 원본 기록 |
| GPT-6 Astra (max)OpenAI | 56.48% | 원본 기록 |
| Grok 4.6 (high)SpaceXAI | 56.48% | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 56.37% | 원본 기록 |
| Grok 4.5 (high)SpaceXAI | 54.98% | 원본 기록 |
| GPT-5.6 Terra (max)OpenAI | 54.98% | 원본 기록 |
LiveCodeBench15 개 성적
코딩 문제 풀이
- gpt-oss-120b87.83%
- ERNIE 5.0 Thinking Preview81.16%
- o380.85%
- Apriel-v1.6-15B-Thinker80.74%
- Qwen3 Next 80B A3B (Reasoning)78.41%
- INTELLECT-377.67%
- gpt-oss-20b77.67%
- K-EXAONE76.83%
- Doubao Seed Code76.61%
- Magistral Medium 1.275.03%
- EXAONE 4.0 32B74.71%
- NVIDIA Nemotron 3 Nano 30B A3B74.07%
- Llama Nemotron Super 49B v1.573.65%
- Nova 2.0 Pro Preview73.02%
- Falcon-H1R-7B72.38%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| gpt-oss-120b (high)OpenAI | 87.83% | 원본 기록 |
| ERNIE 5.0 Thinking PreviewBaidu | 81.16% | 원본 기록 |
| o3OpenAI | 80.85% | 원본 기록 |
| Apriel-v1.6-15B-ThinkerServiceNow | 80.74% | 원본 기록 |
| Qwen3 Next 80B A3B (Reasoning)Alibaba | 78.41% | 원본 기록 |
| INTELLECT-3Prime Intellect | 77.67% | 원본 기록 |
| gpt-oss-20b (high)OpenAI | 77.67% | 원본 기록 |
| K-EXAONE (Reasoning)LG AI Research | 76.83% | 원본 기록 |
| Doubao Seed CodeByteDance Seed | 76.61% | 원본 기록 |
| Magistral Medium 1.2Mistral | 75.03% | 원본 기록 |
| EXAONE 4.0 32B (Reasoning)LG AI Research | 74.71% | 원본 기록 |
| NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)NVIDIA | 74.07% | 원본 기록 |
| Llama Nemotron Super 49B v1.5 (Reasoning)NVIDIA | 73.65% | 원본 기록 |
| Nova 2.0 Pro Preview (medium)Amazon | 73.02% | 원본 기록 |
| Falcon-H1R-7BTII UAE | 72.38% | 원본 기록 |
SciCode / MiniMax report7 개 성적
과학 분야 프로그래밍 과제.
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Gemini 3 Pro (MiniMax internal evaluation)Google | 56 | 원본 기록 |
| Claude Opus 4.6 (MiniMax internal evaluation)Anthropic | 52 | 원본 기록 |
| GPT-5.2 (Thinking; MiniMax internal evaluation)OpenAI | 52 | 원본 기록 |
| Claude Opus 4.5 (MiniMax internal evaluation)Anthropic | 50 | 원본 기록 |
| Claude Sonnet 4.5 (MiniMax internal evaluation)Anthropic | 45 | 원본 기록 |
| MiniMax-M2.5 (MiniMax internal evaluation)MiniMax | 44.4 | 원본 기록 |
| MiniMax-M2.1 (MiniMax internal evaluation)MiniMax | 41 | 원본 기록 |
Terminal Bench 2.1 / DeepSeek GA report8 개 성적
터미널에서 수행하는 코딩과 도구 사용 과제.
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Kimi K3 (Code-agent evaluation; harness and reasoning effort not disclosed for this model)Moonshot AI | 88.3 | 원본 기록 |
| Fable-5 (w/ fallback) (Code-agent evaluation; harness and reasoning effort not disclosed for this model; with fallback, details unspecified)Anthropic | 88 | 원본 기록 |
| DeepSeek-V4-Pro-0813 (DeepSeek Harness minimal; max reasoning effort; temperature=1.0; top_p=0.95)DeepSeek | 87.9 | 원본 기록 |
| Opus-4.8 (Code-agent evaluation; harness and reasoning effort not disclosed for this model)Anthropic | 85 | 원본 기록 |
| DeepSeek-V4-Flash-0731 (Code-agent evaluation; harness and reasoning effort not disclosed for this model)DeepSeek | 82.7 | 원본 기록 |
| GLM-5.2 (Code-agent evaluation; harness and reasoning effort not disclosed for this model)Z.ai | 81 | 원본 기록 |
| DeepSeek-V4-Pro (Preview) (Code-agent evaluation; harness and reasoning effort not disclosed for this model)DeepSeek | 72.1 | 원본 기록 |
| DeepSeek-V4-Flash (Preview) (Code-agent evaluation; harness and reasoning effort not disclosed for this model)DeepSeek | 61.8 | 원본 기록 |
SWE-bench Pro refined set / Qwen3.8-Max report5 개 성적
Qwen이 수정한 SWE-bench Pro 평가셋의 코드 수정 과제.
- Fable 580
- Opus 4.869.2
- Qwen3.8-Max67.7
- GPT 5.6 Sol (max)64.6
- Qwen3.7-Max60.6
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Fable 5 (Qwen-refined set; Claude Code; temperature=1.0; top_p=0.95; 256K context; may involve fallback; reasoning effort not disclosed)Anthropic | 80 | 원본 기록 |
| Opus 4.8 (Qwen-refined set; Claude Code; temperature=1.0; top_p=0.95; 256K context; reasoning effort not disclosed)Anthropic | 69.2 | 원본 기록 |
| Qwen3.8-Max service model; Qwen-refined set; Claude Code; temperature=1.0; top_p=0.95; 256K context; reasoning effort not disclosedQwen | 67.7 | 원본 기록 |
| GPT 5.6 Sol (max) (Qwen-refined set; Claude Code; max (table header); temperature=1.0; top_p=0.95; 256K context)OpenAI | 64.6 | 원본 기록 |
| Qwen3.7-Max (Qwen-refined set; Claude Code; temperature=1.0; top_p=0.95; 256K context; reasoning effort not disclosed)Qwen | 60.6 | 원본 기록 |
SWE-bench Verified / Google G31 (2026-02-19)5 개 성적
모델과 코딩 실행 환경이 저장소 문제를 해결하는 비율입니다.
- Claude Opus 4.680.8%
- Gemini 3.1 Pro80.6%
- GPT-5.280%
- Claude Sonnet 4.679.6%
- Gemini 3 Pro76.2%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Claude Opus 4.6 (Thinking (Max); Single attempt; provider-specific scaffolding)Anthropic | 80.8% | 원본 기록 |
| Gemini 3.1 Pro (Thinking (High); Single attempt; provider-specific scaffolding)Google | 80.6% | 원본 기록 |
| GPT-5.2 (Thinking (xhigh); Single attempt; provider-specific scaffolding)OpenAI | 80% | 원본 기록 |
| Claude Sonnet 4.6 (Thinking (Max); Single attempt; provider-specific scaffolding)Anthropic | 79.6% | 원본 기록 |
| Gemini 3 Pro (Thinking (High); Single attempt; provider-specific scaffolding)Google | 76.2% | 원본 기록 |
SWE-bench Pro (Public) / Google G31 (2026-02-19)4 개 성적
SWE-bench Pro 공개판의 소프트웨어 개발 과제입니다.
- GPT-5.3-Codex56.8%
- GPT-5.255.6%
- Gemini 3.1 Pro54.2%
- Gemini 3 Pro43.3%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| GPT-5.3-Codex (Thinking (xhigh); Public split; single attempt; provider-specific scaffolding)OpenAI | 56.8% | 원본 기록 |
| GPT-5.2 (Thinking (xhigh); Public split; single attempt; provider-specific scaffolding)OpenAI | 55.6% | 원본 기록 |
| Gemini 3.1 Pro (Thinking (High); Public split; single attempt; provider-specific scaffolding)Google | 54.2% | 원본 기록 |
| Gemini 3 Pro (Thinking (High); Public split; single attempt; provider-specific scaffolding)Google | 43.3% | 원본 기록 |
모델 추론
Intelligence Index v4.215 개 성적
10개 평가 종합 지수
- Claude Fable 5.156.76
- GPT-6 Astra54.66
- Claude Opus 554.05
- Claude Fable 553.19
- Muse Spark 1.352.95
- GPT-5.6 Sol51.26
- Grok 4.650.58
- Kimi K350.23
- GLM-5.348.58
- Gemini 3.8 Flash47.07
- Qwen3.8 Max46.91
- Muse Spark 1.246.84
- GPT-5.6 Terra46.77
- Qwen3.8 2.4T A95B46.74
- GLM 5.3 Flash46.22
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 56.76 | 원본 기록 |
| GPT-6 Astra (max)OpenAI | 54.66 | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 54.05 | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 53.19 | 원본 기록 |
| Muse Spark 1.3 (max)Meta | 52.95 | 원본 기록 |
| GPT-5.6 Sol (max)OpenAI | 51.26 | 원본 기록 |
| Grok 4.6 (high)SpaceXAI | 50.58 | 원본 기록 |
| Kimi K3 (max)Kimi | 50.23 | 원본 기록 |
| GLM-5.3 (max)Z AI | 48.58 | 원본 기록 |
| Gemini 3.8 Flash (high)Google | 47.07 | 원본 기록 |
| Qwen3.8 MaxAlibaba | 46.91 | 원본 기록 |
| Muse Spark 1.2 (xhigh)Meta | 46.84 | 원본 기록 |
| GPT-5.6 Terra (max)OpenAI | 46.77 | 원본 기록 |
| Qwen3.8 2.4T A95BAlibaba | 46.74 | 원본 기록 |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 46.22 | 원본 기록 |
Humanity's Last Exam15 개 성적
전문 지식과 고난도 추론
- Claude Fable 5.159.13%
- Claude Fable 555.47%
- Claude Opus 554.87%
- GPT-6 Astra54.68%
- GPT-5.6 Sol49.49%
- Muse Spark 1.349.07%
- Gemini 3.7 Flash47.87%
- Gemini 3.8 Flash47.82%
- Gemini 3.1 Pro Preview47.03%
- Kimi K346.9%
- Muse Spark 1.245.46%
- Grok 4.644.07%
- Qwen3.8 Max43.05%
- GPT-5.6 Terra42.91%
- Grok 4.542.68%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 59.13% | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 55.47% | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 54.87% | 원본 기록 |
| GPT-6 Astra (max)OpenAI | 54.68% | 원본 기록 |
| GPT-5.6 Sol (max)OpenAI | 49.49% | 원본 기록 |
| Muse Spark 1.3 (max)Meta | 49.07% | 원본 기록 |
| Gemini 3.7 Flash (high)Google | 47.87% | 원본 기록 |
| Gemini 3.8 Flash (high)Google | 47.82% | 원본 기록 |
| Gemini 3.1 Pro PreviewGoogle | 47.03% | 원본 기록 |
| Kimi K3 (max)Kimi | 46.9% | 원본 기록 |
| Muse Spark 1.2 (xhigh)Meta | 45.46% | 원본 기록 |
| Grok 4.6 (xhigh)SpaceXAI | 44.07% | 원본 기록 |
| Qwen3.8 MaxAlibaba | 43.05% | 원본 기록 |
| GPT-5.6 Terra (max)OpenAI | 42.91% | 원본 기록 |
| Grok 4.5 (high)SpaceXAI | 42.68% | 원본 기록 |
GPQA Diamond15 개 성적
대학원 수준 과학 추론
- GPT-6 Astra96.26%
- Gemini 3.8 Flash95.25%
- Grok 4.694.95%
- Gemini 3.7 Flash94.55%
- Gemini 3.1 Pro Preview94.14%
- Muse Spark 1.394.14%
- GPT-5.6 Sol94.14%
- Claude Opus 593.74%
- Claude Fable 5.193.74%
- Qwen3.8 2.4T A95B93.54%
- Kimi K393.54%
- Grok 4.593.13%
- MiniMax-M392.93%
- Gemini 3.6 Flash92.83%
- DeepSeek V4 Pro 081392.83%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| GPT-6 Astra (xhigh)OpenAI | 96.26% | 원본 기록 |
| Gemini 3.8 Flash (high)Google | 95.25% | 원본 기록 |
| Grok 4.6 (high)SpaceXAI | 94.95% | 원본 기록 |
| Gemini 3.7 Flash (high)Google | 94.55% | 원본 기록 |
| Gemini 3.1 Pro PreviewGoogle | 94.14% | 원본 기록 |
| Muse Spark 1.3 (xhigh)Meta | 94.14% | 원본 기록 |
| GPT-5.6 Sol (max)OpenAI | 94.14% | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic | 93.74% | 원본 기록 |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 93.74% | 원본 기록 |
| Qwen3.8 2.4T A95BAlibaba | 93.54% | 원본 기록 |
| Kimi K3 (max)Kimi | 93.54% | 원본 기록 |
| Grok 4.5 (high)SpaceXAI | 93.13% | 원본 기록 |
| MiniMax-M3MiniMax | 92.93% | 원본 기록 |
| Gemini 3.6 Flash (high)Google | 92.83% | 원본 기록 |
| DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek | 92.83% | 원본 기록 |
CritPt15 개 성적
연구 수준 물리 문제
- GPT-5.6 Sol32.29%
- GPT-6 Astra31.71%
- Claude Fable 5.131.14%
- GPT-5.5 Pro30.57%
- GPT-5.6 Terra30%
- Claude Opus 529.14%
- Claude Fable 528.57%
- Muse Spark 1.326%
- Gemini 3 Deep Think25.71%
- Kimi K323.43%
- GLM-5.220.86%
- GPT-5.6 Luna20.57%
- Qwen3.8 Max20%
- Qwen3.8 2.4T A95B20%
- Grok 4.619.71%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| GPT-5.6 Sol (max)OpenAI | 32.29% | 원본 기록 |
| GPT-6 Astra (max)OpenAI | 31.71% | 원본 기록 |
| Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropic | 31.14% | 원본 기록 |
| GPT-5.5 Pro (xhigh)OpenAI | 30.57% | 원본 기록 |
| GPT-5.6 Terra (max)OpenAI | 30% | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 29.14% | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 28.57% | 원본 기록 |
| Muse Spark 1.3 (xhigh)Meta | 26% | 원본 기록 |
| Gemini 3 Deep ThinkGoogle | 25.71% | 원본 기록 |
| Kimi K3 (max)Kimi | 23.43% | 원본 기록 |
| GLM-5.2 (max)Z AI | 20.86% | 원본 기록 |
| GPT-5.6 Luna (max)OpenAI | 20.57% | 원본 기록 |
| Qwen3.8 MaxAlibaba | 20% | 원본 기록 |
| Qwen3.8 2.4T A95BAlibaba | 20% | 원본 기록 |
| Grok 4.6 (xhigh)SpaceXAI | 19.71% | 원본 기록 |
AIME 202515 개 성적
경시대회 수학 문제
- Nova 2.0 Lite94.33%
- gpt-oss-120b93.44%
- NVIDIA Nemotron 3 Nano 30B A3B91%
- K-EXAONE90.33%
- Nova 2.0 Omni89.67%
- gpt-oss-20b89.33%
- Nova 2.0 Pro Preview89%
- o388.33%
- INTELLECT-388%
- Apriel-v1.6-15B-Thinker88%
- ERNIE 5.0 Thinking Preview85%
- Qwen3 Next 80B A3B (Reasoning)84.33%
- Ring-flash-2.083.67%
- Claude 4.5 Haiku83.67%
- Magistral Medium 1.282%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Nova 2.0 Lite (high)Amazon | 94.33% | 원본 기록 |
| gpt-oss-120b (high)OpenAI | 93.44% | 원본 기록 |
| NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)NVIDIA | 91% | 원본 기록 |
| K-EXAONE (Reasoning)LG AI Research | 90.33% | 원본 기록 |
| Nova 2.0 Omni (medium)Amazon | 89.67% | 원본 기록 |
| gpt-oss-20b (high)OpenAI | 89.33% | 원본 기록 |
| Nova 2.0 Pro Preview (medium)Amazon | 89% | 원본 기록 |
| o3OpenAI | 88.33% | 원본 기록 |
| INTELLECT-3Prime Intellect | 88% | 원본 기록 |
| Apriel-v1.6-15B-ThinkerServiceNow | 88% | 원본 기록 |
| ERNIE 5.0 Thinking PreviewBaidu | 85% | 원본 기록 |
| Qwen3 Next 80B A3B (Reasoning)Alibaba | 84.33% | 원본 기록 |
| Ring-flash-2.0InclusionAI | 83.67% | 원본 기록 |
| Claude 4.5 Haiku (Reasoning)Anthropic | 83.67% | 원본 기록 |
| Magistral Medium 1.2Mistral | 82% | 원본 기록 |
IFBench15 개 성적
복잡한 지시 이행
- Grok 4.383.33%
- MiniMax-M382.86%
- Nemotron 3 Ultra 550B A55B81.36%
- Nemotron Cascade 2 30B A3B80.41%
- MiMo-V2.5-Pro79.86%
- Nova 2.0 Pro Preview79.59%
- Qwen3.5 397B A17B78.78%
- Qwen3.7 Plus77.96%
- Gemini 3.1 Pro Preview77.14%
- DeepSeek V4 Pro 042476.46%
- Qwen3.5 122B A10B75.71%
- Gemma 4 31B75.58%
- GPT-5.3 Codex75.37%
- Gemini 3.5 Flash74.56%
- Command A+73.95%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Grok 4.3 (medium)SpaceXAI | 83.33% | 원본 기록 |
| MiniMax-M3MiniMax | 82.86% | 원본 기록 |
| Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA | 81.36% | 원본 기록 |
| Nemotron Cascade 2 30B A3BNVIDIA | 80.41% | 원본 기록 |
| MiMo-V2.5-ProXiaomi | 79.86% | 원본 기록 |
| Nova 2.0 Pro Preview (low)Amazon | 79.59% | 원본 기록 |
| Qwen3.5 397B A17B (Reasoning)Alibaba | 78.78% | 원본 기록 |
| Qwen3.7 PlusAlibaba | 77.96% | 원본 기록 |
| Gemini 3.1 Pro PreviewGoogle | 77.14% | 원본 기록 |
| DeepSeek V4 Pro 0424 (DeepSeek V4 Pro (Reasoning, Max Effort))DeepSeek | 76.46% | 원본 기록 |
| Qwen3.5 122B A10B (Reasoning)Alibaba | 75.71% | 원본 기록 |
| Gemma 4 31B (Reasoning)Google | 75.58% | 원본 기록 |
| GPT-5.3 Codex (xhigh)OpenAI | 75.37% | 원본 기록 |
| Gemini 3.5 Flash (medium)Google | 74.56% | 원본 기록 |
| Command A+Cohere | 73.95% | 원본 기록 |
LongBench v2 / Moonshot report5 개 성적
긴 입력을 읽고 추론하는 능력.
- Gemini 3 Pro68.2
- Claude Opus 4.564.4
- Kimi K2.561
- DeepSeek V3.259.8
- GPT-5.254.5
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Gemini 3 Pro (High Thinking Level; publisher rerun (*))Google | 68.2 | 원본 기록 |
| Claude Opus 4.5 (Extended Thinking; publisher rerun (*))Anthropic | 64.4 | 원본 기록 |
| Kimi K2.5 (Thinking)Moonshot AI | 61 | 원본 기록 |
| DeepSeek V3.2 (Thinking; publisher rerun (*))DeepSeek | 59.8 | 원본 기록 |
| GPT-5.2 (xhigh; publisher rerun (*))OpenAI | 54.5 | 원본 기록 |
AIME 2026 I / Z.ai report6 개 성적
2026년 AIME 첫 번째 시험입니다. 2026년 전체 시험과 구분합니다.
- Claude Opus 4.593.3
- GLM-4.792.9
- GLM-592.7
- DeepSeek V3.292.7
- Kimi K2.592.5
- Gemini 3 Pro90.6
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Claude Opus 4.5 (GLM-5 release comparison)Anthropic | 93.3 | 원본 기록 |
| GLM-4.7 (GLM-5 release comparison)Z.ai | 92.9 | 원본 기록 |
| GLM-5 release reportZ.ai | 92.7 | 원본 기록 |
| DeepSeek V3.2 (GLM-5 release comparison)DeepSeek | 92.7 | 원본 기록 |
| Kimi K2.5 (GLM-5 release comparison)Moonshot AI | 92.5 | 원본 기록 |
| Gemini 3 Pro (GLM-5 release comparison)Google | 90.6 | 원본 기록 |
HMMT November 2025 / Z.ai report7 개 성적
2025년 11월 수학 경시대회 문제.
- GPT-5.297.1
- GLM-596.9
- GLM-4.793.5
- Gemini 3 Pro93
- Claude Opus 4.591.7
- Kimi K2.591.1
- DeepSeek V3.290.2
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| GPT-5.2 (xhigh)OpenAI | 97.1 | 원본 기록 |
| GLM-5 release reportZ.ai | 96.9 | 원본 기록 |
| GLM-4.7 (GLM-5 release comparison)Z.ai | 93.5 | 원본 기록 |
| Gemini 3 Pro (GLM-5 release comparison)Google | 93 | 원본 기록 |
| Claude Opus 4.5 (GLM-5 release comparison)Anthropic | 91.7 | 원본 기록 |
| Kimi K2.5 (GLM-5 release comparison)Moonshot AI | 91.1 | 원본 기록 |
| DeepSeek V3.2 (GLM-5 release comparison)DeepSeek | 90.2 | 원본 기록 |
AA-LCR / MiniMax report7 개 성적
긴 입력을 바탕으로 한 추론.
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Claude Opus 4.5 (MiniMax internal evaluation)Anthropic | 74 | 원본 기록 |
| GPT-5.2 (Thinking; MiniMax internal evaluation)OpenAI | 73 | 원본 기록 |
| Claude Opus 4.6 (MiniMax internal evaluation)Anthropic | 71 | 원본 기록 |
| Gemini 3 Pro (MiniMax internal evaluation)Google | 71 | 원본 기록 |
| MiniMax-M2.5 (MiniMax internal evaluation)MiniMax | 69.5 | 원본 기록 |
| Claude Sonnet 4.5 (MiniMax internal evaluation)Anthropic | 66 | 원본 기록 |
| MiniMax-M2.1 (MiniMax internal evaluation)MiniMax | 62 | 원본 기록 |
HLE no tools / DeepSeek GA report8 개 성적
도구를 쓰지 않는 여러 분야의 추론 평가.
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Fable-5 (w/ fallback) (No tools; HLE reasoning effort and token budget not disclosed; with fallback, details unspecified)Anthropic | 53.3 | 원본 기록 |
| Opus-4.8 (No tools; HLE reasoning effort and token budget not disclosed)Anthropic | 49.8 | 원본 기록 |
| Kimi K3 (No tools; HLE reasoning effort and token budget not disclosed)Moonshot AI | 43.5 | 원본 기록 |
| DeepSeek-V4-Pro-0813 (No tools; HLE reasoning effort and token budget not disclosed)DeepSeek | 42.7 | 원본 기록 |
| GLM-5.2 (No tools; HLE reasoning effort and token budget not disclosed)Z.ai | 40.5 | 원본 기록 |
| DeepSeek-V4-Flash-0731 (No tools; HLE reasoning effort and token budget not disclosed)DeepSeek | 37.8 | 원본 기록 |
| DeepSeek-V4-Pro (Preview) (No tools; HLE reasoning effort and token budget not disclosed)DeepSeek | 37.7 | 원본 기록 |
| DeepSeek-V4-Flash (Preview) (No tools; HLE reasoning effort and token budget not disclosed)DeepSeek | 34.8 | 원본 기록 |
HLE with tools / DeepSeek GA report8 개 성적
도구를 사용하는 여러 분야의 추론 평가.
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Fable-5 (w/ fallback) (With tools; specific tools, HLE reasoning effort and token budget not disclosed; with fallback, details unspecified)Anthropic | 63 | 원본 기록 |
| DeepSeek-V4-Pro-0813 (With tools; specific tools, HLE reasoning effort and token budget not disclosed)DeepSeek | 60 | 원본 기록 |
| Opus-4.8 (With tools; specific tools, HLE reasoning effort and token budget not disclosed)Anthropic | 57.9 | 원본 기록 |
| Kimi K3 (With tools; specific tools, HLE reasoning effort and token budget not disclosed)Moonshot AI | 56 | 원본 기록 |
| GLM-5.2 (With tools; specific tools, HLE reasoning effort and token budget not disclosed)Z.ai | 54.7 | 원본 기록 |
| DeepSeek-V4-Flash-0731 (With tools; specific tools, HLE reasoning effort and token budget not disclosed)DeepSeek | 51.5 | 원본 기록 |
| DeepSeek-V4-Pro (Preview) (With tools; specific tools, HLE reasoning effort and token budget not disclosed)DeepSeek | 48.2 | 원본 기록 |
| DeepSeek-V4-Flash (Preview) (With tools; specific tools, HLE reasoning effort and token budget not disclosed)DeepSeek | 45.1 | 원본 기록 |
HMMT February 2026 / DeepSeek Preview report6 개 성적
답 하나의 성공률인 Pass@1로 측정한 수학 경시대회 문제 풀이.
- GPT-5.4 xHigh97.7%
- Opus-4.6 Max96.2%
- DS-V4-Pro Max95.2%
- Gemini-3.1-Pro High94.7%
- K2.6 Thinking92.7%
- GLM-5.1 Thinking89.4%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| GPT-5.4 xHigh (xHigh; DeepSeek Preview report comparison)OpenAI | 97.7% | 원본 기록 |
| Opus-4.6 Max (Max; DeepSeek Preview report comparison)Anthropic | 96.2% | 원본 기록 |
| DS-V4-Pro Max (Preview; Max; temperature=1.0; 384K-token context; distinct rigorous-proof math prompt)DeepSeek | 95.2% | 원본 기록 |
| Gemini-3.1-Pro High (High; DeepSeek Preview report comparison)Google | 94.7% | 원본 기록 |
| K2.6 Thinking (Thinking; DeepSeek Preview report comparison)Moonshot AI | 92.7% | 원본 기록 |
| GLM-5.1 Thinking (Thinking; DeepSeek Preview report comparison)Z.ai | 89.4% | 원본 기록 |
LongBench v2 / Qwen3.8-Max report4 개 성적
긴 문서와 입력을 읽고 추론하는 능력.
- Opus 4.869.1
- GPT 5.6 Sol (max)67.1
- Qwen3.8-Max66.3
- Qwen3.7-Max65.3
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Opus 4.8 (LongBench v2; tools, reasoning effort and token budget not disclosed)Anthropic | 69.1 | 원본 기록 |
| GPT 5.6 Sol (max) (max (table header); LongBench v2 tools and token budget not disclosed)OpenAI | 67.1 | 원본 기록 |
| Qwen3.8-Max service model; LongBench v2 tools, reasoning effort and token budget not disclosedQwen | 66.3 | 원본 기록 |
| Qwen3.7-Max (LongBench v2; tools, reasoning effort and token budget not disclosed)Qwen | 65.3 | 원본 기록 |
GPQA Diamond / Google G31 (2026-02-19)5 개 성적
도구 없이 과학 지식과 추론을 평가합니다.
- Gemini 3.1 Pro94.3%
- GPT-5.292.4%
- Gemini 3 Pro91.9%
- Claude Opus 4.691.3%
- Claude Sonnet 4.689.9%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Gemini 3.1 Pro (Thinking (High); No tools)Google | 94.3% | 원본 기록 |
| GPT-5.2 (Thinking (xhigh); No tools)OpenAI | 92.4% | 원본 기록 |
| Gemini 3 Pro (Thinking (High); No tools)Google | 91.9% | 원본 기록 |
| Claude Opus 4.6 (Thinking (Max); No tools)Anthropic | 91.3% | 원본 기록 |
| Claude Sonnet 4.6 (Thinking (Max); No tools)Anthropic | 89.9% | 원본 기록 |
HLE, no tools / Google G31 (2026-02-19)5 개 성적
전체 텍스트와 멀티모달 HLE 문항을 도구 없이 풉니다.
- Gemini 3.1 Pro44.4%
- Claude Opus 4.640%
- Gemini 3 Pro37.5%
- GPT-5.234.5%
- Claude Sonnet 4.633.2%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Gemini 3.1 Pro (Thinking (High); No tools)Google | 44.4% | 원본 기록 |
| Claude Opus 4.6 (Thinking (Max); No tools)Anthropic | 40% | 원본 기록 |
| Gemini 3 Pro (Thinking (High); No tools)Google | 37.5% | 원본 기록 |
| GPT-5.2 (Thinking (xhigh); No tools)OpenAI | 34.5% | 원본 기록 |
| Claude Sonnet 4.6 (Thinking (Max); No tools)Anthropic | 33.2% | 원본 기록 |
HLE, search and code / Google G31 (2026-02-19)5 개 성적
검색과 코드 실행을 사용한 HLE 추론 평가입니다.
- Claude Opus 4.653.1%
- Gemini 3.1 Pro51.4%
- Claude Sonnet 4.649%
- Gemini 3 Pro45.8%
- GPT-5.245.5%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Claude Opus 4.6 (Thinking (Max); Search and code; provider-specific tools)Anthropic | 53.1% | 원본 기록 |
| Gemini 3.1 Pro (Thinking (High); Search and code; provider-specific tools)Google | 51.4% | 원본 기록 |
| Claude Sonnet 4.6 (Thinking (Max); Search and code; provider-specific tools)Anthropic | 49% | 원본 기록 |
| Gemini 3 Pro (Thinking (High); Search and code; provider-specific tools)Google | 45.8% | 원본 기록 |
| GPT-5.2 (Thinking (xhigh); Search and code; provider-specific tools)OpenAI | 45.5% | 원본 기록 |
ARC-AGI-2 / Google G31 (2026-02-19)5 개 성적
격자 예시에서 처음 보는 규칙을 추론합니다.
- Gemini 3.1 Pro77.1%
- Claude Opus 4.668.8%
- Claude Sonnet 4.658.3%
- GPT-5.252.9%
- Gemini 3 Pro31.1%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Gemini 3.1 Pro (Thinking (High); ARC Prize Verified; semi-private set)Google | 77.1% | 원본 기록 |
| Claude Opus 4.6 (Thinking (Max); ARC Prize Verified; semi-private set)Anthropic | 68.8% | 원본 기록 |
| Claude Sonnet 4.6 (Thinking (Max); ARC Prize Verified; semi-private set)Anthropic | 58.3% | 원본 기록 |
| GPT-5.2 (Thinking (xhigh); ARC Prize Verified; semi-private set)OpenAI | 52.9% | 원본 기록 |
| Gemini 3 Pro (Thinking (High); ARC Prize Verified; semi-private set)Google | 31.1% | 원본 기록 |
AIME 2025, no tools / Google G3F (2025-12-17)7 개 성적
2025년 AIME 수학 경시대회 문제 풀이입니다.
- GPT-5.2100%
- Gemini 3 Flash95.2%
- Gemini 3 Pro95%
- Grok 4.1 Fast91.9%
- Gemini 2.5 Pro88%
- Claude Sonnet 4.587%
- Gemini 2.5 Flash72%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| GPT-5.2 (Extra high; No tools)OpenAI | 100% | 원본 기록 |
| Gemini 3 Flash (Thinking; exact level unspecified; No tools)Google | 95.2% | 원본 기록 |
| Gemini 3 Pro (Thinking; exact level unspecified; No tools)Google | 95% | 원본 기록 |
| Grok 4.1 Fast (Reasoning; No tools)xAI | 91.9% | 원본 기록 |
| Gemini 2.5 Pro (Thinking; exact level unspecified; No tools)Google | 88% | 원본 기록 |
| Claude Sonnet 4.5 (Thinking; high preferred, otherwise best available reported setting; No tools)Anthropic | 87% | 원본 기록 |
| Gemini 2.5 Flash (Thinking; exact level unspecified; No tools)Google | 72% | 원본 기록 |
AIME 2025, code execution / Google G3F (2025-12-17)4 개 성적
2025년 AIME 수학 경시대회 문제 풀이입니다.
- Gemini 3 Pro100%
- Claude Sonnet 4.5100%
- Gemini 3 Flash99.7%
- Gemini 2.5 Flash75.7%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Gemini 3 Pro (Thinking; exact level unspecified; Code execution)Google | 100% | 원본 기록 |
| Claude Sonnet 4.5 (Thinking; high preferred, otherwise best available reported setting; Code execution)Anthropic | 100% | 원본 기록 |
| Gemini 3 Flash (Thinking; exact level unspecified; Code execution)Google | 99.7% | 원본 기록 |
| Gemini 2.5 Flash (Thinking; exact level unspecified; Code execution)Google | 75.7% | 원본 기록 |
HLE, no tools / Anthropic A51 (2026-09-01)3 개 성적
기존 HLE 멀티모달 2,500문항을 도구 없이 풉니다.
- Claude Fable 5.160.9%
- Claude Fable 557.8%
- Claude Opus 556.6%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Claude Fable 5.1 (Adaptive thinking (auto); max effort; default sampling; five-trial mean; total token cap 1M; no compaction; production safeguards enabled; No tools)Anthropic | 60.9% | 원본 기록 |
| Claude Fable 5 (Detailed reasoning setting and budget unverified; production safeguards enabled; No tools)Anthropic | 57.8% | 원본 기록 |
| Claude Opus 5 (Detailed reasoning setting and budget unverified; No tools)Anthropic | 56.6% | 원본 기록 |
HLE, tools / Anthropic A51 (2026-09-01)3 개 성적
검색, 웹 문서 가져오기, 코드 도구를 사용하는 기존 HLE 추론 평가입니다.
- Claude Fable 5.165%
- Claude Fable 563.8%
- Claude Opus 563.6%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Claude Fable 5.1 (Adaptive thinking (auto); max effort; default sampling; five-trial mean; total token cap 1M; no compaction; production safeguards enabled; Search; restricted fetch; programmatic tool calling; code execution)Anthropic | 65% | 원본 기록 |
| Claude Fable 5 (Detailed reasoning setting and budget unverified; production safeguards enabled; Search; restricted fetch; programmatic tool calling; code execution)Anthropic | 63.8% | 원본 기록 |
| Claude Opus 5 (Detailed reasoning setting and budget unverified; Search; restricted fetch; programmatic tool calling; code execution)Anthropic | 63.6% | 원본 기록 |
ARC-AGI-2 / Anthropic A51 (2026-09-01)4 개 성적
9월 발표 비교표의 새로운 격자 규칙 추론 평가입니다.
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| GPT-5.6 Sol (Exact reasoning setting and token budget unverified)OpenAI | 92.5% | 원본 기록 |
| Claude Opus 5 (Exact reasoning setting and token budget unverified)Anthropic | 90.42% | 원본 기록 |
| Claude Fable 5.1 / Claude Mythos 5.1 (Fable 5.1: max effort; semi-private set; ARC Prize Verified)Anthropic | 90% | 원본 기록 |
| Claude Fable 5 / Claude Mythos 5 (Exact reasoning setting and token budget unverified)Anthropic | 89.2% | 원본 기록 |
HLE-Verified / Google G38 (2026-09-02)6 개 성적
검증과 수정을 거친 1,811문항의 전문 지식 추론 평가입니다.
- Gemini 3.8 Flash54.9%
- GPT-5.6 Sol54.5%
- Claude Opus 554.4%
- Gemini 3.7 Flash53.6%
- GPT-5.6 Terra51.1%
- Claude Sonnet 531%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Gemini 3.8 Flash (Default sampling; exact thinking level unspecified; HLE-Verified; 1811 items; tool use unspecified)Google | 54.9% | 원본 기록 |
| GPT-5.6 Sol (Exact reasoning level unspecified; HLE-Verified; 1811 items; tool use unspecified)OpenAI | 54.5% | 원본 기록 |
| Claude Opus 5 (Exact thinking level unspecified; HLE-Verified; 1811 items; tool use unspecified)Anthropic | 54.4% | 원본 기록 |
| Gemini 3.7 Flash (Exact thinking level unspecified; HLE-Verified; 1811 items; tool use unspecified)Google | 53.6% | 원본 기록 |
| GPT-5.6 Terra (Maximum reasoning preferred; otherwise best available reported setting; HLE-Verified; 1811 items; tool use unspecified)OpenAI | 51.1% | 원본 기록 |
| Claude Sonnet 5 (Maximum thinking preferred; otherwise best available reported setting; HLE-Verified; 1811 items; tool use unspecified)Anthropic | 31% | 원본 기록 |
문서와 맥락 이해
AA-LCR v1.115 개 성적
긴 자료를 읽고 추론
- Kimi K388.67%
- Claude Fable 5.185.33%
- Muse Spark 1.384.33%
- Gemini 3.8 Flash84%
- GPT-5.6 Sol84%
- GPT-5.6 Luna83.67%
- Muse Glimmer83.33%
- GPT-5.3 Codex83.33%
- MiniMax-M383%
- GPT-5.6 Terra83%
- Gemini 3.7 Flash83%
- Agnes 2.5 Pro Beta83%
- Claude Fable 582.33%
- Claude Sonnet 582%
- Qwen3.8 27B82%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Kimi K3 (max)Kimi | 88.67% | 원본 기록 |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 85.33% | 원본 기록 |
| Muse Spark 1.3 (max)Meta | 84.33% | 원본 기록 |
| Gemini 3.8 Flash (medium)Google | 84% | 원본 기록 |
| GPT-5.6 Sol (max)OpenAI | 84% | 원본 기록 |
| GPT-5.6 Luna (max)OpenAI | 83.67% | 원본 기록 |
| Muse Glimmer (high)Meta | 83.33% | 원본 기록 |
| GPT-5.3 Codex (xhigh)OpenAI | 83.33% | 원본 기록 |
| MiniMax-M3MiniMax | 83% | 원본 기록 |
| GPT-5.6 Terra (max)OpenAI | 83% | 원본 기록 |
| Gemini 3.7 Flash (medium)Google | 83% | 원본 기록 |
| Agnes 2.5 Pro BetaSapiens AI | 83% | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 82.33% | 원본 기록 |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 82% | 원본 기록 |
| Qwen3.8 27B (xhigh)Alibaba | 82% | 원본 기록 |
MMMU-Pro15 개 성적
이미지를 읽고 추론
- GPT-6 Astra86.88%
- Gemini 3.8 Flash85.61%
- Gemini 3.7 Flash85.49%
- Claude Opus 584.74%
- Gemini 3.5 Flash83.87%
- GPT-5.6 Sol83.41%
- Gemini 3.6 Flash83.24%
- Gemini 3.1 Pro Preview82.43%
- Qwen3.8 Max82.31%
- Muse Spark 1.382.02%
- GPT-5.6 Terra80.69%
- Kimi K380.52%
- Qwen3.7 Plus80.46%
- Grok 4.580.4%
- Qwen3.8-Flash-Next79.77%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| GPT-6 Astra (max)OpenAI | 86.88% | 원본 기록 |
| Gemini 3.8 Flash (high)Google | 85.61% | 원본 기록 |
| Gemini 3.7 Flash (high)Google | 85.49% | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 84.74% | 원본 기록 |
| Gemini 3.5 Flash (medium)Google | 83.87% | 원본 기록 |
| GPT-5.6 Sol (max)OpenAI | 83.41% | 원본 기록 |
| Gemini 3.6 Flash (high)Google | 83.24% | 원본 기록 |
| Gemini 3.1 Pro PreviewGoogle | 82.43% | 원본 기록 |
| Qwen3.8 MaxAlibaba | 82.31% | 원본 기록 |
| Muse Spark 1.3 (xhigh)Meta | 82.02% | 원본 기록 |
| GPT-5.6 Terra (max)OpenAI | 80.69% | 원본 기록 |
| Kimi K3 (max)Kimi | 80.52% | 원본 기록 |
| Qwen3.7 PlusAlibaba | 80.46% | 원본 기록 |
| Grok 4.5 (high)SpaceXAI | 80.4% | 원본 기록 |
| Qwen3.8-Flash-NextAlibaba | 79.77% | 원본 기록 |
AA-Omniscience / Index15 개 성적
지식 정확성과 잘못된 답변
- GPT-6 Astra43.73
- Claude Fable 5.143.45
- Claude Fable 543.3
- Claude Opus 537.07
- Gemini 3.1 Pro Preview31.88
- Grok 4.630.48
- Gemini 3.8 Flash29.55
- Muse Spark 1.227.2
- Gemini 3.7 Flash26.48
- Grok 4.525.32
- Muse Spark 1.324.93
- Gemini 3.6 Flash22.13
- GPT-5.6 Sol21.97
- Gemini 3.5 Flash20.82
- Kimi K319.7
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| GPT-6 Astra (high)OpenAI | 43.73 | 원본 기록 |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 43.45 | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 43.3 | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 37.07 | 원본 기록 |
| Gemini 3.1 Pro PreviewGoogle | 31.88 | 원본 기록 |
| Grok 4.6 (high)SpaceXAI | 30.48 | 원본 기록 |
| Gemini 3.8 Flash (high)Google | 29.55 | 원본 기록 |
| Muse Spark 1.2 (xhigh)Meta | 27.2 | 원본 기록 |
| Gemini 3.7 Flash (high)Google | 26.48 | 원본 기록 |
| Grok 4.5 (high)SpaceXAI | 25.32 | 원본 기록 |
| Muse Spark 1.3 (max)Meta | 24.93 | 원본 기록 |
| Gemini 3.6 Flash (high)Google | 22.13 | 원본 기록 |
| GPT-5.6 Sol (max)OpenAI | 21.97 | 원본 기록 |
| Gemini 3.5 Flash (medium)Google | 20.82 | 원본 기록 |
| Kimi K3 (max)Kimi | 19.7 | 원본 기록 |
AA-Omniscience / Accuracy15 개 성적
지식 질문 정답률
- Claude Fable 5.167.23%
- Claude Fable 565.35%
- GPT-6 Astra62.6%
- Claude Opus 560.87%
- GPT-5.6 Sol59.4%
- Gemini 3.7 Flash55.32%
- Gemini 3.1 Pro Preview54.85%
- Gemini 3.8 Flash54.6%
- GPT-5.3 Codex52.88%
- Grok 4.551.55%
- Gemini 3.5 Flash51.05%
- Gemini 3.6 Flash49.97%
- DeepSeek V4 Pro 081349.1%
- Grok 4.648.23%
- Kimi K347.58%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 67.23% | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 65.35% | 원본 기록 |
| GPT-6 Astra (max)OpenAI | 62.6% | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 60.87% | 원본 기록 |
| GPT-5.6 Sol (max)OpenAI | 59.4% | 원본 기록 |
| Gemini 3.7 Flash (high)Google | 55.32% | 원본 기록 |
| Gemini 3.1 Pro PreviewGoogle | 54.85% | 원본 기록 |
| Gemini 3.8 Flash (high)Google | 54.6% | 원본 기록 |
| GPT-5.3 Codex (xhigh)OpenAI | 52.88% | 원본 기록 |
| Grok 4.5 (high)SpaceXAI | 51.55% | 원본 기록 |
| Gemini 3.5 Flash (medium)Google | 51.05% | 원본 기록 |
| Gemini 3.6 Flash (high)Google | 49.97% | 원본 기록 |
| DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek | 49.1% | 원본 기록 |
| Grok 4.6 (high)SpaceXAI | 48.23% | 원본 기록 |
| Kimi K3 (max)Kimi | 47.58% | 원본 기록 |
AA-Omniscience / Hallucination15 개 성적
잘못된 답변 비율, 낮을수록 좋음
- MiniCPM5-1B0.9%
- G9v3-3B11.66%
- G9v3-39A5B13.04%
- Command A+14.16%
- LFM2.5-2.6B16%
- Grok 4.316.94%
- Qwen3.8 27B18.09%
- MiniMax-M318.43%
- Quasar 438B21.44%
- K-EXAONE 2.0 080322.6%
- Grok 4.624%
- Solar Pro 424.4%
- MiMo-V2.5-Pro24.7%
- Solar Open2 250B25.38%
- Granite 4.2 30B25.58%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| MiniCPM5-1B (Non-reasoning)OpenBMB | 0.9% | 원본 기록 |
| G9v3-3BAI9Stars | 11.66% | 원본 기록 |
| G9v3-39A5BAI9Stars | 13.04% | 원본 기록 |
| Command A+Cohere | 14.16% | 원본 기록 |
| LFM2.5-2.6BLiquid AI | 16% | 원본 기록 |
| Grok 4.3 (medium)SpaceXAI | 16.94% | 원본 기록 |
| Qwen3.8 27B (Non-reasoning)Alibaba | 18.09% | 원본 기록 |
| MiniMax-M3MiniMax | 18.43% | 원본 기록 |
| Quasar 438B (max, based on GLM-5.2)Multiverse Computing | 21.44% | 원본 기록 |
| K-EXAONE 2.0 0803 (K-EXAONE 2.0)LG AI Research | 22.6% | 원본 기록 |
| Grok 4.6 (medium)SpaceXAI | 24% | 원본 기록 |
| Solar Pro 4Upstage | 24.4% | 원본 기록 |
| MiMo-V2.5-ProXiaomi | 24.7% | 원본 기록 |
| Solar Open2 250BUpstage | 25.38% | 원본 기록 |
| Granite 4.2 30BIBM | 25.58% | 원본 기록 |
MathVision / Moonshot report5 개 성적
그림이 포함된 수학 문제 풀이.
- Gemini 3 Pro86.1
- Kimi K2.584.2
- GPT-5.283
- Claude Opus 4.577.1
- Qwen3-VL-235B-A22B74.6
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Gemini 3 Pro (High Thinking Level; publisher rerun (*))Google | 86.1 | 원본 기록 |
| Kimi K2.5 (Thinking)Moonshot AI | 84.2 | 원본 기록 |
| GPT-5.2 (xhigh)OpenAI | 83 | 원본 기록 |
| Claude Opus 4.5 (Extended Thinking; publisher rerun (*))Anthropic | 77.1 | 원본 기록 |
| Qwen3-VL-235B-A22B (Thinking)Qwen | 74.6 | 원본 기록 |
OCRBench / Moonshot report5 개 성적
이미지 안의 글자 인식.
- Kimi K2.592.3
- Gemini 3 Pro90.3
- Qwen3-VL-235B-A22B87.5
- Claude Opus 4.586.5
- GPT-5.280.7
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Kimi K2.5 (Thinking)Moonshot AI | 92.3 | 원본 기록 |
| Gemini 3 Pro (High Thinking Level; publisher rerun (*))Google | 90.3 | 원본 기록 |
| Qwen3-VL-235B-A22B (Thinking)Qwen | 87.5 | 원본 기록 |
| Claude Opus 4.5 (Extended Thinking; publisher rerun (*))Anthropic | 86.5 | 원본 기록 |
| GPT-5.2 (xhigh; publisher rerun (*))OpenAI | 80.7 | 원본 기록 |
OmniDocBench 1.5 / Moonshot report5 개 성적
문서 읽기. 발표 점수는 정규화 편집거리의 보수를 100점으로 환산한 값입니다.
- Kimi K2.588.8
- Gemini 3 Pro88.5
- Claude Opus 4.587.7
- GPT-5.285.7
- Qwen3-VL-235B-A22B82
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Kimi K2.5 (Thinking)Moonshot AI | 88.8 | 원본 기록 |
| Gemini 3 Pro (High Thinking Level)Google | 88.5 | 원본 기록 |
| Claude Opus 4.5 (Extended Thinking; publisher rerun (*))Anthropic | 87.7 | 원본 기록 |
| GPT-5.2 (xhigh)OpenAI | 85.7 | 원본 기록 |
| Qwen3-VL-235B-A22B (Thinking; publisher rerun (*))Qwen | 82 | 원본 기록 |
VideoMMMU / Moonshot report5 개 성적
여러 분야의 영상 이해.
- Gemini 3 Pro87.6
- Kimi K2.586.6
- GPT-5.285.9
- Claude Opus 4.584.4
- Qwen3-VL-235B-A22B80
MotionBench / Moonshot report4 개 성적
영상 속 움직임 이해.
- Kimi K2.570.4
- Gemini 3 Pro70.3
- GPT-5.264.8
- Claude Opus 4.560.3
IFBench / MiniMax report7 개 성적
세부 지시 준수.
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| GPT-5.2 (Thinking; MiniMax internal evaluation)OpenAI | 75 | 원본 기록 |
| MiniMax-M2.5 (MiniMax internal evaluation)MiniMax | 70 | 원본 기록 |
| MiniMax-M2.1 (MiniMax internal evaluation)MiniMax | 70 | 원본 기록 |
| Gemini 3 Pro (MiniMax internal evaluation)Google | 70 | 원본 기록 |
| Claude Opus 4.5 (MiniMax internal evaluation)Anthropic | 58 | 원본 기록 |
| Claude Sonnet 4.5 (MiniMax internal evaluation)Anthropic | 57 | 원본 기록 |
| Claude Opus 4.6 (MiniMax internal evaluation)Anthropic | 53 | 원본 기록 |
MMMLU / DeepSeek Base report3 개 성적
예시 5개를 제공하고 정답 일치율로 측정한 다국어 지식.
- DeepSeek-V4-Pro-Base90.3%
- DeepSeek-V4-Flash-Base88.8%
- DeepSeek-V3.2-Base87.9%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| DeepSeek-V4-Pro-Base (Base; MMMLU EM; 5-shot; shared internal evaluation setup; sampling and tools not disclosed)DeepSeek | 90.3% | 원본 기록 |
| DeepSeek-V4-Flash-Base (Base; MMMLU EM; 5-shot; shared internal evaluation setup; sampling and tools not disclosed)DeepSeek | 88.8% | 원본 기록 |
| DeepSeek-V3.2-Base (Base; MMMLU EM; 5-shot; shared internal evaluation setup; sampling and tools not disclosed)DeepSeek | 87.9% | 원본 기록 |
OmniDocBench 1.5 / Qwen3.8-27B report5 개 성적
제공사가 발표한 점수로 비교하는 문서 이미지 읽기.
- Qwen3.7-Plus91.4
- Qwen3.8-27B91.1
- Qwen3.6-27B89.4
- Opus4.6 Max86.6
- Muse Glimmer-30B75.8
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Qwen3.7-Plus (OmniDocBench 1.5; tools, reasoning effort and image settings not disclosed)Qwen | 91.4 | 원본 기록 |
| Qwen3.8-27B (OmniDocBench 1.5; tools, reasoning effort and image settings not disclosed)Qwen | 91.1 | 원본 기록 |
| Qwen3.6-27B (OmniDocBench 1.5; tools, reasoning effort and image settings not disclosed)Qwen | 89.4 | 원본 기록 |
| Opus4.6 Max (Max (table header); OmniDocBench 1.5 tools and image settings not disclosed)Anthropic | 86.6 | 원본 기록 |
| Muse Glimmer-30B (OmniDocBench 1.5; tools, reasoning effort and image settings not disclosed)Meta | 75.8 | 원본 기록 |
MMMU-Pro / Google G31 (2026-02-19)5 개 성적
도구 없이 이미지 등 여러 형태의 정보를 이해하고 추론합니다.
- Gemini 3 Pro81%
- Gemini 3.1 Pro80.5%
- GPT-5.279.5%
- Claude Sonnet 4.674.5%
- Claude Opus 4.673.9%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Gemini 3 Pro (Thinking (High); No tools; Standard (10 options) and Vision average)Google | 81% | 원본 기록 |
| Gemini 3.1 Pro (Thinking (High); No tools; Standard (10 options) and Vision average)Google | 80.5% | 원본 기록 |
| GPT-5.2 (Thinking (xhigh); No tools; Standard (10 options) and Vision average)OpenAI | 79.5% | 원본 기록 |
| Claude Sonnet 4.6 (Thinking (Max); No tools; Standard (10 options) and Vision average)Anthropic | 74.5% | 원본 기록 |
| Claude Opus 4.6 (Thinking (Max); No tools; Standard (10 options) and Vision average)Anthropic | 73.9% | 원본 기록 |
MRCR v2, 128k / Google G31 (2026-02-19)5 개 성적
긴 문맥에서 지정 정보 8개를 찾는 평가의 128k까지 누적 평균입니다.
- Gemini 3.1 Pro84.9%
- Claude Sonnet 4.684.9%
- Claude Opus 4.684%
- GPT-5.283.8%
- Gemini 3 Pro77%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Gemini 3.1 Pro (Thinking (High); MRCR v2; 8 needles; 128k cumulative average)Google | 84.9% | 원본 기록 |
| Claude Sonnet 4.6 (Thinking (Max); MRCR v2; 8 needles; 128k cumulative average)Anthropic | 84.9% | 원본 기록 |
| Claude Opus 4.6 (Thinking (Max); MRCR v2; 8 needles; 128k cumulative average)Anthropic | 84% | 원본 기록 |
| GPT-5.2 (Thinking (xhigh); MRCR v2; 8 needles; 128k cumulative average)OpenAI | 83.8% | 원본 기록 |
| Gemini 3 Pro (Thinking (High); MRCR v2; 8 needles; 128k cumulative average)Google | 77% | 원본 기록 |
MRCR v2, 1M / Google G31 (2026-02-19)2 개 성적
1M 토큰 길이에서 지정 정보 8개를 찾는 평가입니다.
- Gemini 3.1 Pro26.3%
- Gemini 3 Pro26.3%
CharXiv Reasoning / Google G38 (2026-09-02)6 개 성적
도구 없이 복잡한 차트의 정보를 종합합니다.
- Gemini 3.8 Flash86.2%
- GPT-5.6 Terra85.9%
- GPT-5.6 Sol85.8%
- Gemini 3.7 Flash84.5%
- Claude Opus 583.7%
- Claude Sonnet 570.1%
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Gemini 3.8 Flash (Default sampling; exact thinking level unspecified; No tools)Google | 86.2% | 원본 기록 |
| GPT-5.6 Terra (Maximum reasoning preferred; otherwise best available reported setting; No tools)OpenAI | 85.9% | 원본 기록 |
| GPT-5.6 Sol (Exact reasoning level unspecified; No tools)OpenAI | 85.8% | 원본 기록 |
| Gemini 3.7 Flash (Exact thinking level unspecified; No tools)Google | 84.5% | 원본 기록 |
| Claude Opus 5 (Exact thinking level unspecified; No tools)Anthropic | 83.7% | 원본 기록 |
| Claude Sonnet 5 (Maximum thinking preferred; otherwise best available reported setting; No tools)Anthropic | 70.1% | 원본 기록 |
검색 모델
MTEB / OpenAI embeddings report3 개 성적
텍스트를 검색용 수치로 바꾸는 임베딩 모델 평가입니다. 생성형 모델 추론과 구분합니다.
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| text-embedding-3-large (Published MTEB result; evaluation dimensions unspecified)OpenAI | 64.6% | 원본 기록 |
| text-embedding-3-small (Published MTEB result; evaluation dimensions unspecified)OpenAI | 62.3% | 원본 기록 |
| text-embedding-ada-002 (Published MTEB result; evaluation dimensions unspecified)OpenAI | 61% | 원본 기록 |
시간과 비용
Intelligence Index / Cost per task15 개 성적
평가 과제당 가중 평균 비용
- GLM 5.3 Flash0.18
- Muse Spark 1.20.55
- Gemini 3.8 Flash0.74
- GPT-5.6 Terra0.81
- Muse Spark 1.30.96
- Qwen3.8 2.4T A95B1.1
- Qwen3.8 Max1.19
- GPT-5.6 Sol1.25
- Grok 4.61.25
- GLM-5.31.26
- Kimi K31.58
- GPT-6 Astra2.57
- Claude Opus 54.21
- Claude Fable 55.62
- Claude Fable 5.16.12
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 0.18 | 원본 기록 |
| Muse Spark 1.2 (xhigh)Meta | 0.55 | 원본 기록 |
| Gemini 3.8 Flash (high)Google | 0.74 | 원본 기록 |
| GPT-5.6 Terra (max)OpenAI | 0.81 | 원본 기록 |
| Muse Spark 1.3 (max)Meta | 0.96 | 원본 기록 |
| Qwen3.8 2.4T A95BAlibaba | 1.1 | 원본 기록 |
| Qwen3.8 MaxAlibaba | 1.19 | 원본 기록 |
| GPT-5.6 Sol (max)OpenAI | 1.25 | 원본 기록 |
| Grok 4.6 (high)SpaceXAI | 1.25 | 원본 기록 |
| GLM-5.3 (max)Z AI | 1.26 | 원본 기록 |
| Kimi K3 (max)Kimi | 1.58 | 원본 기록 |
| GPT-6 Astra (max)OpenAI | 2.57 | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 4.21 | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 5.62 | 원본 기록 |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 6.12 | 원본 기록 |
Output speed15 개 성적
출력 생성 속도
- Gemini 3.8 Flash280.76
- Muse Spark 1.2269.24
- Muse Spark 1.3233.15
- GPT-5.6 Terra113.93
- GLM-5.383.31
- GPT-5.6 Sol75.78
- Claude Fable 5.168.22
- GPT-6 Astra64.26
- Claude Fable 562.97
- Grok 4.659.89
- Claude Opus 555.95
- GLM 5.3 Flash50.63
- Kimi K341.61
- Qwen3.8 2.4T A95B40.23
- Qwen3.8 Max40.15
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| Gemini 3.8 Flash (high)Google | 280.76 | 원본 기록 |
| Muse Spark 1.2 (xhigh)Meta | 269.24 | 원본 기록 |
| Muse Spark 1.3 (max)Meta | 233.15 | 원본 기록 |
| GPT-5.6 Terra (max)OpenAI | 113.93 | 원본 기록 |
| GLM-5.3 (max)Z AI | 83.31 | 원본 기록 |
| GPT-5.6 Sol (max)OpenAI | 75.78 | 원본 기록 |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 68.22 | 원본 기록 |
| GPT-6 Astra (max)OpenAI | 64.26 | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 62.97 | 원본 기록 |
| Grok 4.6 (high)SpaceXAI | 59.89 | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 55.95 | 원본 기록 |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 50.63 | 원본 기록 |
| Kimi K3 (max)Kimi | 41.61 | 원본 기록 |
| Qwen3.8 2.4T A95BAlibaba | 40.23 | 원본 기록 |
| Qwen3.8 MaxAlibaba | 40.15 | 원본 기록 |
API input price15 개 성적
입력 100만 토큰 가격
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 0.15 | 원본 기록 |
| Gemini 3.8 Flash (high)Google | 0.75 | 원본 기록 |
| Muse Spark 1.3 (max)Meta | 1.25 | 원본 기록 |
| Muse Spark 1.2 (xhigh)Meta | 1.25 | 원본 기록 |
| GLM-5.3 (max)Z AI | 1.4 | 원본 기록 |
| Grok 4.6 (high)SpaceXAI | 2 | 원본 기록 |
| Qwen3.8 MaxAlibaba | 2 | 원본 기록 |
| GPT-5.6 Terra (max)OpenAI | 2 | 원본 기록 |
| Qwen3.8 2.4T A95BAlibaba | 2 | 원본 기록 |
| Kimi K3 (max)Kimi | 3 | 원본 기록 |
| GPT-5.6 Sol (max)OpenAI | 4 | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 5 | 원본 기록 |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 10 | 원본 기록 |
| GPT-6 Astra (max)OpenAI | 10 | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 10 | 원본 기록 |
API output price15 개 성적
출력 100만 토큰 가격
| 모델과 실행 구성 | 성적 | 출처 |
|---|---|---|
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 0.5 | 원본 기록 |
| Gemini 3.8 Flash (high)Google | 3.75 | 원본 기록 |
| Muse Spark 1.3 (max)Meta | 4.25 | 원본 기록 |
| Muse Spark 1.2 (xhigh)Meta | 4.25 | 원본 기록 |
| GLM-5.3 (max)Z AI | 4.4 | 원본 기록 |
| Grok 4.6 (high)SpaceXAI | 6 | 원본 기록 |
| Qwen3.8 MaxAlibaba | 6 | 원본 기록 |
| Qwen3.8 2.4T A95BAlibaba | 6 | 원본 기록 |
| GPT-5.6 Terra (max)OpenAI | 12 | 원본 기록 |
| Kimi K3 (max)Kimi | 15 | 원본 기록 |
| GPT-5.6 Sol (max)OpenAI | 20 | 원본 기록 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 25 | 원본 기록 |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 50 | 원본 기록 |
| GPT-6 Astra (max)OpenAI | 50 | 원본 기록 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 50 | 원본 기록 |
본문 출처와 더 읽을 자료
- Anthropic. Demystifying evals for AI agents
- OpenAI. GDPval
- OpenAI. BrowseComp
- Parallel. Deep Research price-performance
- LangChain. Improving Deep Agents with harness engineering
- LangChain. Deep Agents source code
- DeepResearch Bench II. Evaluation code
- ResearchRubrics. Evaluation code
- Agents’ Last Exam. Tasks and evaluation