HDATF RESEARCH / BENCHMARK REPORT
What makes AI ready for real work?
Reading public evidence, testing the complete system, and defining what HDATF must prove next.
The finding
Public benchmarks help choose a model and design a test. Readiness for work must be established with the actual files, tools and completion criteria of the system being deployed.
This report interprets archived public results through three practical concerns: usable deliverables, traceable evidence and reliable execution. HDATF has not published its own measured scores for these evaluations. The final chapter therefore sets out an evaluation plan.
73 evaluations and metrics684 archived scores
Begin with the work you need done.
A benchmark is a repeatable test with a defined task and scoring rule. A reasoning test, a document comparison and a tool-use task each observe a different part of an AI system. Their scores answer different questions.
For a document workflow, success means the requested file can be opened, its evidence can be checked and its content meets the brief. For data analysis, the output must also be reproducible from the supplied data. A general model ranking does not resolve either decision on its own.
We use public results to narrow candidates and identify failure modes worth testing. To decide whether a method belongs in LabChin, we then need a matched task using our own sources, permissions, tools and output checks. This report follows that order.[1]
Judge the deliverable against the actual brief.
GDPval makes professional deliverables the object of comparison. Its original Gold study used 220 tasks across 44 occupations, with experts comparing outputs without knowing who produced them. The chart reproduces three archived results from that study.
A win-or-tie rate describes those comparisons. It is not the proportion of jobs an organization can hand over to AI. The task set, reviewer judgment and model configurations define how far the result can be interpreted.[2]
GDPval Gold
Expert comparison: wins + ties (%)
- Claude Opus 4.147.6%
- GPT-5 (high)38.8%
- o3 (high)34.1%
| Model and configuration | Score | Source |
|---|---|---|
| Claude Opus 4.1Anthropic | 47.6% | Original record |
| GPT-5 (high)OpenAI | 38.8% | Original record |
| o3 (high)OpenAI | 34.1% | Original record |
220 gold tasks across 44 occupations. Blind, pairwise expert grading in the original study. These are historical results, not current model rankings.
Source: OpenAI2025-09Original record
For HDATF, the practical question is how much work remains after the file is produced. A review should retain missing requirements, unsupported numbers and the revisions a person had to make. A polished layout is one part of quality; it cannot compensate for incorrect evidence or an unusable file.
Finding an answer and supporting a report are separate checks.
BrowseComp tests whether a system can locate difficult facts. Parallel's published comparison used a random sample of 100 questions from the 1,266-question set. It reported both accuracy and request cost. The results below therefore describe a sampled, provider-run experiment.[3][4]
BrowseComp / Parallel study
Correct answers (%)
| Model and configuration | Score | Source |
|---|---|---|
| Parallel Ultra8xParallel | 58% | Original record |
| Parallel UltraParallel | 45% | Original record |
| GPT-5 (high)OpenAI | 38% | Original record |
Random sample of 100 of 1,266 questions. Measured 11–29 August 2025 by Parallel. Ultra8x: $2.40/request; Ultra: $0.30; GPT-5: $0.488. Configurations and budgets differ.
Source: Parallel2025-09-09Original record
Ultra8x reported 58% accuracy at $2.40 per request; Ultra reported 45% at $0.30. Their budgets differ. These figures make the accuracy-cost tradeoff visible, but do not isolate the effect of the underlying model or prove an advantage at equal cost.
A research report needs additional checks. DeepResearch Bench II and ResearchRubrics examine report content against explicit criteria. For LabChin, we plan to retain the passages supporting each major claim, identify contradictory evidence and record which parts of the question remain unanswered.
The model works inside a system. Evaluate that system.
An agent harness is the software that supplies a model with tools, context and control over a task. LangChain held GPT-5.2-Codex fixed while changing this surrounding software. Its Terminal-Bench 2.0 result rose from 52.8% to 66.5% across 89 tasks.[5][6]
Terminal-Bench 2.0
Task success (%)
| Model and configuration | Score | Source |
|---|---|---|
| Deep Agents / improvedLangChain | 66.5% | Original record |
| Deep Agents / baselineLangChain | 52.8% | Original record |
89 tasks. GPT-5.2-Codex held fixed; LangChain changed prompts, tools and middleware. Harbor / Daytona execution. The post reports a 13.7 percentage-point improvement.
Source: LangChain2026-02-17Original record
The study changed instructions, tools and middleware together, including checks before completion and guidance about the environment. The 13.7-point difference belongs to that combined experiment. It does not establish the contribution of each individual change or predict HDATF's improvement.
This suggests a testable choice for our own work: hold the task and model fixed, then compare a workflow with and without output verification. Keep the produced file, verification result, retries and elapsed time. The test should explain both successful completion and the failures that required intervention.
Memory needs a separate test. Recalling an old fact is useful only if the system also handles corrections and keeps information within its permitted scope. The archived LoCoMo result covers single-hop recall; it does not verify these work-level requirements. We therefore keep it as supporting evidence in the appendix.
The next evidence must be our own work, measured.
The public studies identify useful questions; they do not supply a score for our product. Our next step is a recorded comparison on representative tasks. We plan to assess evidence retrieval, analysis and usable delivery separately, so a strong result in one area cannot hide a failure in another.
For research and data work, preserve the question, source versions and checks on the final output. A report should expose unsupported claims. An analysis should retain the input data, execution record and reproducible outputs. The following criteria define what we intend to inspect, not completed tests.[1][7][8][9]
Planned evaluation. No HDATF score published.
Find the evidence
BrowseComp tests finding hard-to-locate facts on the web. For LabChin, we also want to check whether each cited source supports the claim made from it.
Build a sound analysis
DeepResearch Bench II and ResearchRubrics provide criteria for research reports. We plan to check coverage, factual support and the reasoning behind the conclusion, not just fluent writing.
Deliver usable work
GDPval and Agents’ Last Exam examine professional tasks. We plan to check whether the requested work is complete, the files are usable, and a person still has to repair the result.
| Evaluation scope | Keep as evidence | Decision it supports |
|---|---|---|
| Task | Brief, input files and acceptance criteria | Did the requested work get done? |
| Execution | Model, tools, permissions and configuration version | Can another run use the same conditions? |
| Outcome | Output files, source checks and human corrections | Is the output correct and usable? |
| Efficiency | Elapsed time, tools, retries and total cost | Is the complete workflow affordable? |
Appendix. The complete evidence
Compare published scores by evaluation. Select a model name to open its source. Results reflect the recorded date; model-family comparisons show the best measured configuration for each family.
73 / 73 evaluations and metrics
Work and documents
AA-Briefcase15 results
Long-horizon knowledge work
- Claude Fable 5.11,661.91
- Claude Opus 51,647.02
- GPT-6 Astra1,561.95
- Muse Spark 1.31,558.85
- Grok 4.61,545.82
- Claude Fable 51,533.52
- GLM-5.31,515.45
- Kimi K31,496.83
- GPT-5.6 Sol1,474.49
- GLM 5.3 Flash1,459.13
- Qwen3.8 2.4T A95B1,442.81
- DeepSeek V4 Flash 07311,433.23
- Qwen3.8 27B1,401.81
- Qwen3.8 Max1,392.33
- Claude Sonnet 51,358.11
| Model and configuration | Score | Source |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 1,661.91 | Original record |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 1,647.02 | Original record |
| GPT-6 Astra (max)OpenAI | 1,561.95 | Original record |
| Muse Spark 1.3 (max)Meta | 1,558.85 | Original record |
| Grok 4.6 (xhigh)SpaceXAI | 1,545.82 | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 1,533.52 | Original record |
| GLM-5.3 (max)Z AI | 1,515.45 | Original record |
| Kimi K3 (max)Kimi | 1,496.83 | Original record |
| GPT-5.6 Sol (max)OpenAI | 1,474.49 | Original record |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 1,459.13 | Original record |
| Qwen3.8 2.4T A95BAlibaba | 1,442.81 | Original record |
| DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek | 1,433.23 | Original record |
| Qwen3.8 27B (xhigh)Alibaba | 1,401.81 | Original record |
| Qwen3.8 MaxAlibaba | 1,392.33 | Original record |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 1,358.11 | Original record |
AA-Briefcase / Rubric15 results
Required checks passed
- Claude Fable 5.161.52%
- Claude Opus 557.98%
- Claude Fable 555.96%
- Muse Spark 1.354.87%
- Grok 4.653.84%
- GPT-6 Astra52.32%
- GLM-5.351.35%
- Kimi K350.97%
- Qwen3.8 2.4T A95B50%
- Qwen3.8 Max49.6%
- Qwen3.8 27B47.8%
- GLM 5.3 Flash46.36%
- DeepSeek V4 Flash 073146.15%
- Muse Spark 1.245.15%
- DeepSeek V4 Pro 081343.52%
| Model and configuration | Score | Source |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 61.52% | Original record |
| Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic | 57.98% | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 55.96% | Original record |
| Muse Spark 1.3 (max)Meta | 54.87% | Original record |
| Grok 4.6 (xhigh)SpaceXAI | 53.84% | Original record |
| GPT-6 Astra (xhigh)OpenAI | 52.32% | Original record |
| GLM-5.3 (max)Z AI | 51.35% | Original record |
| Kimi K3 (max)Kimi | 50.97% | Original record |
| Qwen3.8 2.4T A95BAlibaba | 50% | Original record |
| Qwen3.8 MaxAlibaba | 49.6% | Original record |
| Qwen3.8 27B (xhigh)Alibaba | 47.8% | Original record |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 46.36% | Original record |
| DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek | 46.15% | Original record |
| Muse Spark 1.2 (xhigh)Meta | 45.15% | Original record |
| DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek | 43.52% | Original record |
AA-Briefcase / Analytical quality15 results
Quality of analysis
- Claude Fable 5.11,959.49
- Claude Opus 51,909.74
- GLM-5.31,788.62
- GPT-6 Astra1,753.64
- Muse Spark 1.31,711.52
- Grok 4.61,682.58
- Claude Fable 51,676.55
- Kimi K31,668.89
- GLM 5.3 Flash1,650.95
- Qwen3.8 2.4T A95B1,617.45
- DeepSeek V4 Flash 07311,617.37
- Qwen3.8 27B1,590.24
- GPT-5.6 Sol1,537.92
- Qwen3.8 Max1,533.14
- Claude Sonnet 51,418.22
| Model and configuration | Score | Source |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 1,959.49 | Original record |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 1,909.74 | Original record |
| GLM-5.3 (max)Z AI | 1,788.62 | Original record |
| GPT-6 Astra (max)OpenAI | 1,753.64 | Original record |
| Muse Spark 1.3 (max)Meta | 1,711.52 | Original record |
| Grok 4.6 (xhigh)SpaceXAI | 1,682.58 | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 1,676.55 | Original record |
| Kimi K3 (max)Kimi | 1,668.89 | Original record |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 1,650.95 | Original record |
| Qwen3.8 2.4T A95BAlibaba | 1,617.45 | Original record |
| DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek | 1,617.37 | Original record |
| Qwen3.8 27B (xhigh)Alibaba | 1,590.24 | Original record |
| GPT-5.6 Sol (max)OpenAI | 1,537.92 | Original record |
| Qwen3.8 MaxAlibaba | 1,533.14 | Original record |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 1,418.22 | Original record |
AA-Briefcase / Presentation15 results
Deliverable presentation
- GPT-5.6 Sol1,633.93
- Claude Opus 51,544.01
- GPT-6 Astra1,535.29
- GPT-5.6 Terra1,519.13
- Grok 4.61,514.68
- Muse Spark 1.31,506.83
- Claude Fable 5.11,472.7
- GPT-5.6 Luna1,471.03
- Claude Fable 51,456.83
- Kimi K31,435.29
- Claude Sonnet 51,409.5
- GLM 5.3 Flash1,409.12
- DeepSeek V4 Flash 07311,355.99
- GLM-5.31,354.5
- Muse Spark 1.21,334.35
| Model and configuration | Score | Source |
|---|---|---|
| GPT-5.6 Sol (max)OpenAI | 1,633.93 | Original record |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 1,544.01 | Original record |
| GPT-6 Astra (max)OpenAI | 1,535.29 | Original record |
| GPT-5.6 Terra (max)OpenAI | 1,519.13 | Original record |
| Grok 4.6 (xhigh)SpaceXAI | 1,514.68 | Original record |
| Muse Spark 1.3 (max)Meta | 1,506.83 | Original record |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 1,472.7 | Original record |
| GPT-5.6 Luna (max)OpenAI | 1,471.03 | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 1,456.83 | Original record |
| Kimi K3 (max)Kimi | 1,435.29 | Original record |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 1,409.5 | Original record |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 1,409.12 | Original record |
| DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek | 1,355.99 | Original record |
| GLM-5.3 (max)Z AI | 1,354.5 | Original record |
| Muse Spark 1.2 (xhigh)Meta | 1,334.35 | Original record |
GDPval-AA v215 results
Real-world professional work
- Claude Fable 5.11,765.9
- Claude Opus 51,738.08
- Muse Spark 1.31,719.65
- GLM-5.31,678.47
- GLM 5.3 Flash1,672.94
- Grok 4.61,664.82
- Qwen3.8-Flash-Next1,649.93
- Claude Fable 51,635.39
- Qwen3.8 Max1,633.53
- Qwen3.8 2.4T A95B1,630.39
- GPT-5.6 Sol1,625.68
- Kimi K31,585.72
- GPT-6 Astra1,582.24
- DeepSeek V4 Flash 07311,579.3
- Muse Spark 1.21,525.03
| Model and configuration | Score | Source |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 1,765.9 | Original record |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 1,738.08 | Original record |
| Muse Spark 1.3 (max)Meta | 1,719.65 | Original record |
| GLM-5.3 (max)Z AI | 1,678.47 | Original record |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 1,672.94 | Original record |
| Grok 4.6 (xhigh)SpaceXAI | 1,664.82 | Original record |
| Qwen3.8-Flash-NextAlibaba | 1,649.93 | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 1,635.39 | Original record |
| Qwen3.8 MaxAlibaba | 1,633.53 | Original record |
| Qwen3.8 2.4T A95BAlibaba | 1,630.39 | Original record |
| GPT-5.6 Sol (max)OpenAI | 1,625.68 | Original record |
| Kimi K3 (max)Kimi | 1,585.72 | Original record |
| GPT-6 Astra (max)OpenAI | 1,582.24 | Original record |
| DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek | 1,579.3 | Original record |
| Muse Spark 1.2 (xhigh)Meta | 1,525.03 | Original record |
AA-AnalystAgent / pass^515 results
Reliable spreadsheet and document analysis
- Gemini 3.7 Flash60%
- Claude Fable 5.157.5%
- Claude Opus 553.75%
- GPT-6 Astra51.25%
- Claude Fable 548.75%
- GPT-5.6 Sol47.5%
- Claude Sonnet 546.25%
- Gemini 3.1 Pro Preview41.25%
- Grok 4.641.25%
- Kimi K338.75%
- Grok 4.535%
- Inkling Small27.5%
- Inkling23.75%
- MiMo-V2.5-Pro20%
- DeepSeek V4 Pro 042418.75%
| Model and configuration | Score | Source |
|---|---|---|
| Gemini 3.7 Flash (high)Google | 60% | Original record |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 57.5% | Original record |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 53.75% | Original record |
| GPT-6 Astra (max)OpenAI | 51.25% | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 48.75% | Original record |
| GPT-5.6 Sol (max)OpenAI | 47.5% | Original record |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 46.25% | Original record |
| Gemini 3.1 Pro PreviewGoogle | 41.25% | Original record |
| Grok 4.6 (high)SpaceXAI | 41.25% | Original record |
| Kimi K3 (max)Kimi | 38.75% | Original record |
| Grok 4.5 (high)SpaceXAI | 35% | Original record |
| Inkling SmallThinking Machines | 27.5% | Original record |
| Inkling (xhigh)Thinking Machines | 23.75% | Original record |
| MiMo-V2.5-ProXiaomi | 20% | Original record |
| DeepSeek V4 Pro 0424 (DeepSeek V4 Pro (Reasoning, Max Effort))DeepSeek | 18.75% | Original record |
GDP.pdf / All-pass15 results
Professional document reasoning
- GPT-6 Astra33.2%
- GPT-5.6 Sol28.2%
- Claude Fable 5.128%
- Muse Spark 1.325.6%
- GPT-5.6 Terra25.6%
- Claude Fable 524%
- GPT-5.6 Luna23.8%
- Gemini 3.7 Flash23.6%
- Gemini 3.8 Flash22.8%
- Qwen3.8 Max21.8%
- Claude Opus 521.6%
- GPT-5.5 Instant (June 2026)20.2%
- Kimi K319.6%
- Grok 4.518.8%
- Grok 4.618.8%
| Model and configuration | Score | Source |
|---|---|---|
| GPT-6 Astra (max)OpenAI | 33.2% | Original record |
| GPT-5.6 Sol (max)OpenAI | 28.2% | Original record |
| Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)Anthropic | 28% | Original record |
| Muse Spark 1.3 (max)Meta | 25.6% | Original record |
| GPT-5.6 Terra (max)OpenAI | 25.6% | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 24% | Original record |
| GPT-5.6 Luna (xhigh)OpenAI | 23.8% | Original record |
| Gemini 3.7 Flash (high)Google | 23.6% | Original record |
| Gemini 3.8 Flash (medium)Google | 22.8% | Original record |
| Qwen3.8 MaxAlibaba | 21.8% | Original record |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 21.6% | Original record |
| GPT-5.5 Instant (June 2026)OpenAI | 20.2% | Original record |
| Kimi K3 (max)Kimi | 19.6% | Original record |
| Grok 4.5 (high)SpaceXAI | 18.8% | Original record |
| Grok 4.6 (high)SpaceXAI | 18.8% | Original record |
AutomationBench-AA15 results
Objectives completed in SaaS workflows
- Gemini 3.7 Flash62.75%
- Kimi K352.71%
- Grok 4.551.44%
- GPT-5.6 Sol51.19%
- Gemini 3.6 Flash51.08%
- Gemini 3.8 Flash50.72%
- Claude Fable 548.58%
- GPT-5.6 Terra45.61%
- GPT-5.6 Luna42.24%
- Claude Sonnet 539.19%
- Gemini 3.1 Pro Preview37.54%
- Gemini 3.5 Flash-Lite32.66%
- GLM-5.227.84%
- Kimi K2.7 Code22.53%
- Qwen3.7 Plus20.43%
| Model and configuration | Score | Source |
|---|---|---|
| Gemini 3.7 Flash (high)Google | 62.75% | Original record |
| Kimi K3 (max)Kimi | 52.71% | Original record |
| Grok 4.5 (high)SpaceXAI | 51.44% | Original record |
| GPT-5.6 Sol (max)OpenAI | 51.19% | Original record |
| Gemini 3.6 Flash (high)Google | 51.08% | Original record |
| Gemini 3.8 Flash (high)Google | 50.72% | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 48.58% | Original record |
| GPT-5.6 Terra (max)OpenAI | 45.61% | Original record |
| GPT-5.6 Luna (max)OpenAI | 42.24% | Original record |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 39.19% | Original record |
| Gemini 3.1 Pro PreviewGoogle | 37.54% | Original record |
| Gemini 3.5 Flash-LiteGoogle | 32.66% | Original record |
| GLM-5.2 (max)Z AI | 27.84% | Original record |
| Kimi K2.7 CodeKimi | 22.53% | Original record |
| Qwen3.7 PlusAlibaba | 20.43% | Original record |
EnterpriseOps-Gym-AA15 results
Enterprise operations
- Claude Fable 551.12%
- Gemini 3.7 Flash50.4%
- DeepSeek V4 Pro 081349.6%
- Grok 4.648.34%
- Claude Opus 547.48%
- Qwen3.8 2.4T A95B47.36%
- Muse Spark 1.247.27%
- DeepSeek V4 Flash 073147.09%
- Kimi K345.33%
- Claude Sonnet 544.67%
- Qwen3.8 27B44.23%
- GPT-5.6 Sol42.91%
- GLM-5.242.73%
- Inkling Small42.7%
- Gemini 3.5 Flash-Lite42.35%
| Model and configuration | Score | Source |
|---|---|---|
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 51.12% | Original record |
| Gemini 3.7 Flash (medium)Google | 50.4% | Original record |
| DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek | 49.6% | Original record |
| Grok 4.6 (high)SpaceXAI | 48.34% | Original record |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 47.48% | Original record |
| Qwen3.8 2.4T A95BAlibaba | 47.36% | Original record |
| Muse Spark 1.2 (xhigh)Meta | 47.27% | Original record |
| DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek | 47.09% | Original record |
| Kimi K3 (max)Kimi | 45.33% | Original record |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 44.67% | Original record |
| Qwen3.8 27B (xhigh)Alibaba | 44.23% | Original record |
| GPT-5.6 Sol (max)OpenAI | 42.91% | Original record |
| GLM-5.2 (max)Z AI | 42.73% | Original record |
| Inkling SmallThinking Machines | 42.7% | Original record |
| Gemini 3.5 Flash-LiteGoogle | 42.35% | Original record |
Harvey LAB-AA15 results
Legal task criteria passed
- Muse Spark 1.395.48%
- Kimi K394.64%
- Claude Fable 593.56%
- Claude Opus 593.46%
- Claude Fable 5.193.27%
- Grok 4.592.42%
- GLM-5.290.97%
- Gemini 3.7 Flash90.66%
- Claude Sonnet 590.07%
- MiniMax-M388.41%
- GPT-5.6 Luna87.9%
- GPT-5.6 Sol87.18%
- GPT-5.6 Terra85.18%
- Gemini 3.6 Flash85.15%
- Kimi K2.7 Code85.02%
| Model and configuration | Score | Source |
|---|---|---|
| Muse Spark 1.3 (xhigh)Meta | 95.48% | Original record |
| Kimi K3 (max)Kimi | 94.64% | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 93.56% | Original record |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 93.46% | Original record |
| Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropic | 93.27% | Original record |
| Grok 4.5 (high)SpaceXAI | 92.42% | Original record |
| GLM-5.2 (max)Z AI | 90.97% | Original record |
| Gemini 3.7 Flash (high)Google | 90.66% | Original record |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 90.07% | Original record |
| MiniMax-M3MiniMax | 88.41% | Original record |
| GPT-5.6 Luna (max)OpenAI | 87.9% | Original record |
| GPT-5.6 Sol (max)OpenAI | 87.18% | Original record |
| GPT-5.6 Terra (max)OpenAI | 85.18% | Original record |
| Gemini 3.6 Flash (high)Google | 85.15% | Original record |
| Kimi K2.7 CodeKimi | 85.02% | Original record |
APEX-Agents-AA14 results
Long-horizon professional tasks
- Kimi K341.3%
- GPT-5.6 Terra38.94%
- GPT-5.6 Luna35.84%
- GLM-5.233.7%
- Gemini 3.1 Pro Preview32.01%
- Apodex 1.131.19%
- DeepSeek V4 Pro 042424.26%
- Qwen3.7 Plus22.42%
- Qwen3.5 397B A17B15.34%
- Step 3.7 Flash14.82%
- gpt-oss-120b3.1%
- MiMo-V2.5-Pro2.43%
- Nemotron 3 Super 120B A12B1.84%
- gpt-oss-20b0.74%
| Model and configuration | Score | Source |
|---|---|---|
| Kimi K3 (max)Kimi | 41.3% | Original record |
| GPT-5.6 Terra (max)OpenAI | 38.94% | Original record |
| GPT-5.6 Luna (max)OpenAI | 35.84% | Original record |
| GLM-5.2 (max)Z AI | 33.7% | Original record |
| Gemini 3.1 Pro PreviewGoogle | 32.01% | Original record |
| Apodex 1.1Apodex | 31.19% | Original record |
| DeepSeek V4 Pro 0424 (DeepSeek V4 Pro (Reasoning, Max Effort))DeepSeek | 24.26% | Original record |
| Qwen3.7 PlusAlibaba | 22.42% | Original record |
| Qwen3.5 397B A17B (Reasoning)Alibaba | 15.34% | Original record |
| Step 3.7 FlashStepFun | 14.82% | Original record |
| gpt-oss-120b (high)OpenAI | 3.1% | Original record |
| MiMo-V2.5-ProXiaomi | 2.43% | Original record |
| Nemotron 3 Super 120B A12B (Reasoning)NVIDIA | 1.84% | Original record |
| gpt-oss-20b (high)OpenAI | 0.74% | Original record |
System studies
GDPval Gold3 results
Can an AI deliver work that a professional would accept? Expert comparison: wins + ties (%)
- Claude Opus 4.147.6%
- GPT-5 (high)38.8%
- o3 (high)34.1%
| Model and configuration | Score | Source |
|---|---|---|
| Claude Opus 4.1Anthropic | 47.6% | Original record |
| GPT-5 (high)OpenAI | 38.8% | Original record |
| o3 (high)OpenAI | 34.1% | Original record |
BrowseComp / Parallel study3 results
Can an agent find and connect hard-to-locate evidence? Correct answers (%)
| Model and configuration | Score | Source |
|---|---|---|
| Parallel Ultra8xParallel | 58% | Original record |
| Parallel UltraParallel | 45% | Original record |
| GPT-5 (high)OpenAI | 38% | Original record |
Terminal-Bench 2.02 results
How much can the execution system change the outcome? Task success (%)
| Model and configuration | Score | Source |
|---|---|---|
| Deep Agents / improvedLangChain | 66.5% | Original record |
| Deep Agents / baselineLangChain | 52.8% | Original record |
LoCoMo / single-hop3 results
Does useful information survive across conversations? LLM-as-a-Judge score, single-hop (0–100)
| Model and configuration | Score | Source |
|---|---|---|
| Mem0Mem0 | 67.13 | Original record |
| LangMemLangChain | 62.23 | Original record |
| ZepZep | 61.7 | Original record |
Agents and tools
τ³-Banking15 results
Banking policies and tool execution
- Muse Spark 1.352.37%
- Qwen3.8 Max51.34%
- Grok 4.650.72%
- GLM-5.350.31%
- Qwen3.8 2.4T A95B49.07%
- Qwen3.8 27B48.04%
- GLM 5.3 Flash47.22%
- Claude Fable 5.147.22%
- Kimi K345.98%
- Gemini 3.8 Flash45.77%
- Qwen3.8-Flash-Next45.36%
- Claude Opus 544.74%
- GPT-5.6 Sol44.33%
- GPT-6 Astra43.09%
- Grok 4.542.06%
| Model and configuration | Score | Source |
|---|---|---|
| Muse Spark 1.3 (max)Meta | 52.37% | Original record |
| Qwen3.8 MaxAlibaba | 51.34% | Original record |
| Grok 4.6 (high)SpaceXAI | 50.72% | Original record |
| GLM-5.3 (max)Z AI | 50.31% | Original record |
| Qwen3.8 2.4T A95BAlibaba | 49.07% | Original record |
| Qwen3.8 27B (xhigh)Alibaba | 48.04% | Original record |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 47.22% | Original record |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 47.22% | Original record |
| Kimi K3 (max)Kimi | 45.98% | Original record |
| Gemini 3.8 Flash (medium)Google | 45.77% | Original record |
| Qwen3.8-Flash-NextAlibaba | 45.36% | Original record |
| Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic | 44.74% | Original record |
| GPT-5.6 Sol (max)OpenAI | 44.33% | Original record |
| GPT-6 Astra (xhigh)OpenAI | 43.09% | Original record |
| Grok 4.5 (high)SpaceXAI | 42.06% | Original record |
τ²-Bench15 results
Conversational tool use
- JT-35B-Flash99.12%
- GLM-5.299.12%
- Step 3.7 Flash98.54%
- Claude Fable 598.54%
- DeepSeek V4 Pro 042496.2%
- Qwen3.5 397B A17B95.61%
- Gemini 3.5 Flash95.61%
- Gemini 3.1 Pro Preview95.61%
- Qwen3.6 35B A3B95.32%
- DeepSeek V4 Flash 042094.44%
- MiMo-V2.5-Pro94.15%
- Qwen3.6 27B94.15%
- Mistral Medium 3.594.15%
- Qwen3.5 122B A10B93.57%
- MiMo-V2-Flash (Feb 2026)93.27%
| Model and configuration | Score | Source |
|---|---|---|
| JT-35B-FlashChina Mobile | 99.12% | Original record |
| GLM-5.2 (max)Z AI | 99.12% | Original record |
| Step 3.7 FlashStepFun | 98.54% | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 98.54% | Original record |
| DeepSeek V4 Pro 0424 (DeepSeek V4 Pro (Reasoning, Max Effort))DeepSeek | 96.2% | Original record |
| Qwen3.5 397B A17B (Reasoning)Alibaba | 95.61% | Original record |
| Gemini 3.5 Flash (medium)Google | 95.61% | Original record |
| Gemini 3.1 Pro PreviewGoogle | 95.61% | Original record |
| Qwen3.6 35B A3B (Reasoning)Alibaba | 95.32% | Original record |
| DeepSeek V4 Flash 0420 (DeepSeek V4 Flash (Non-reasoning))DeepSeek | 94.44% | Original record |
| MiMo-V2.5-ProXiaomi | 94.15% | Original record |
| Qwen3.6 27B (Reasoning)Alibaba | 94.15% | Original record |
| Mistral Medium 3.5Mistral | 94.15% | Original record |
| Qwen3.5 122B A10B (Reasoning)Alibaba | 93.57% | Original record |
| MiMo-V2-Flash (Feb 2026)Xiaomi | 93.27% | Original record |
ITBench-AA15 results
Incident root-cause analysis
- GPT-5.6 Sol56.21%
- GPT-5.6 Terra51.04%
- Kimi K347.69%
- GLM-5.242.66%
- GPT-5.6 Luna40.32%
- DeepSeek V4 Pro 042438.32%
- MiMo-V2.5-Pro38.23%
- Gemma 4 31B37.29%
- Qwen3.5 397B A17B34.09%
- Gemini 3.1 Pro Preview30.33%
- Step 3.7 Flash30.27%
- Claude 4.5 Haiku27.31%
- Gemma 4 26B A4B23.63%
- gpt-oss-120b5.65%
- Nemotron 3 Super 120B A12B1.13%
| Model and configuration | Score | Source |
|---|---|---|
| GPT-5.6 Sol (max)OpenAI | 56.21% | Original record |
| GPT-5.6 Terra (max)OpenAI | 51.04% | Original record |
| Kimi K3 (max)Kimi | 47.69% | Original record |
| GLM-5.2 (max)Z AI | 42.66% | Original record |
| GPT-5.6 Luna (max)OpenAI | 40.32% | Original record |
| DeepSeek V4 Pro 0424 (DeepSeek V4 Pro (Reasoning, Max Effort))DeepSeek | 38.32% | Original record |
| MiMo-V2.5-ProXiaomi | 38.23% | Original record |
| Gemma 4 31B (Reasoning)Google | 37.29% | Original record |
| Qwen3.5 397B A17B (Reasoning)Alibaba | 34.09% | Original record |
| Gemini 3.1 Pro PreviewGoogle | 30.33% | Original record |
| Step 3.7 FlashStepFun | 30.27% | Original record |
| Claude 4.5 Haiku (Reasoning)Anthropic | 27.31% | Original record |
| Gemma 4 26B A4B (Reasoning)Google | 23.63% | Original record |
| gpt-oss-120b (high)OpenAI | 5.65% | Original record |
| Nemotron 3 Super 120B A12B (Reasoning)NVIDIA | 1.13% | Original record |
MCP-Atlas public set / Z.ai report7 results
Completing tasks with connected tools.
- GPT-5.268%
- GLM-567.8%
- Gemini 3 Pro66.6%
- Claude Opus 4.565.2%
- Kimi K2.563.8%
- DeepSeek V3.262.2%
- GLM-4.752%
| Model and configuration | Score | Source |
|---|---|---|
| GPT-5.2 (xhigh)OpenAI | 68% | Original record |
| GLM-5 release reportZ.ai | 67.8% | Original record |
| Gemini 3 Pro (GLM-5 release comparison)Google | 66.6% | Original record |
| Claude Opus 4.5 (GLM-5 release comparison)Anthropic | 65.2% | Original record |
| Kimi K2.5 (GLM-5 release comparison)Moonshot AI | 63.8% | Original record |
| DeepSeek V3.2 (GLM-5 release comparison)DeepSeek | 62.2% | Original record |
| GLM-4.7 (GLM-5 release comparison)Z.ai | 52% | Original record |
Code and execution
Terminal-Bench v2.115 results
Terminal task completion
- Claude Fable 5.191.39%
- GPT-6 Astra89.89%
- GPT-5.6 Sol89.51%
- Claude Opus 589.14%
- Grok 4.688.39%
- GPT-5.6 Terra88.01%
- Gemini 3.8 Flash87.64%
- Qwen3.8-Flash-Next86.14%
- Muse Spark 1.385.77%
- Gemini 3.7 Flash85.77%
- Kimi K385.02%
- Claude Fable 584.64%
- GLM 5.3 Flash84.27%
- GLM-5.383.9%
- Qwen3.8 2.4T A95B82.02%
| Model and configuration | Score | Source |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 91.39% | Original record |
| GPT-6 Astra (high)OpenAI | 89.89% | Original record |
| GPT-5.6 Sol (xhigh)OpenAI | 89.51% | Original record |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 89.14% | Original record |
| Grok 4.6 (high)SpaceXAI | 88.39% | Original record |
| GPT-5.6 Terra (max)OpenAI | 88.01% | Original record |
| Gemini 3.8 Flash (high)Google | 87.64% | Original record |
| Qwen3.8-Flash-NextAlibaba | 86.14% | Original record |
| Muse Spark 1.3 (max)Meta | 85.77% | Original record |
| Gemini 3.7 Flash (high)Google | 85.77% | Original record |
| Kimi K3 (max)Kimi | 85.02% | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 84.64% | Original record |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 84.27% | Original record |
| GLM-5.3 (max)Z AI | 83.9% | Original record |
| Qwen3.8 2.4T A95BAlibaba | 82.02% | Original record |
SciCode15 results
Scientific programming
- Claude Fable 5.163.08%
- Claude Fable 561%
- Gemini 3.7 Flash59.84%
- Muse Spark 1.359.72%
- Kimi K359.49%
- GLM-5.359.03%
- Gemini 3.1 Pro Preview58.68%
- GPT-5.6 Sol57.75%
- Muse Spark 1.257.41%
- Gemini 3.8 Flash56.6%
- GPT-6 Astra56.48%
- Grok 4.656.48%
- Claude Opus 556.37%
- Grok 4.554.98%
- GPT-5.6 Terra54.98%
| Model and configuration | Score | Source |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 63.08% | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 61% | Original record |
| Gemini 3.7 Flash (medium)Google | 59.84% | Original record |
| Muse Spark 1.3 (xhigh)Meta | 59.72% | Original record |
| Kimi K3 (max)Kimi | 59.49% | Original record |
| GLM-5.3 (max)Z AI | 59.03% | Original record |
| Gemini 3.1 Pro PreviewGoogle | 58.68% | Original record |
| GPT-5.6 Sol (high)OpenAI | 57.75% | Original record |
| Muse Spark 1.2 (xhigh)Meta | 57.41% | Original record |
| Gemini 3.8 Flash (high)Google | 56.6% | Original record |
| GPT-6 Astra (max)OpenAI | 56.48% | Original record |
| Grok 4.6 (high)SpaceXAI | 56.48% | Original record |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 56.37% | Original record |
| Grok 4.5 (high)SpaceXAI | 54.98% | Original record |
| GPT-5.6 Terra (max)OpenAI | 54.98% | Original record |
LiveCodeBench15 results
Competitive programming
- gpt-oss-120b87.83%
- ERNIE 5.0 Thinking Preview81.16%
- o380.85%
- Apriel-v1.6-15B-Thinker80.74%
- Qwen3 Next 80B A3B (Reasoning)78.41%
- INTELLECT-377.67%
- gpt-oss-20b77.67%
- K-EXAONE76.83%
- Doubao Seed Code76.61%
- Magistral Medium 1.275.03%
- EXAONE 4.0 32B74.71%
- NVIDIA Nemotron 3 Nano 30B A3B74.07%
- Llama Nemotron Super 49B v1.573.65%
- Nova 2.0 Pro Preview73.02%
- Falcon-H1R-7B72.38%
| Model and configuration | Score | Source |
|---|---|---|
| gpt-oss-120b (high)OpenAI | 87.83% | Original record |
| ERNIE 5.0 Thinking PreviewBaidu | 81.16% | Original record |
| o3OpenAI | 80.85% | Original record |
| Apriel-v1.6-15B-ThinkerServiceNow | 80.74% | Original record |
| Qwen3 Next 80B A3B (Reasoning)Alibaba | 78.41% | Original record |
| INTELLECT-3Prime Intellect | 77.67% | Original record |
| gpt-oss-20b (high)OpenAI | 77.67% | Original record |
| K-EXAONE (Reasoning)LG AI Research | 76.83% | Original record |
| Doubao Seed CodeByteDance Seed | 76.61% | Original record |
| Magistral Medium 1.2Mistral | 75.03% | Original record |
| EXAONE 4.0 32B (Reasoning)LG AI Research | 74.71% | Original record |
| NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)NVIDIA | 74.07% | Original record |
| Llama Nemotron Super 49B v1.5 (Reasoning)NVIDIA | 73.65% | Original record |
| Nova 2.0 Pro Preview (medium)Amazon | 73.02% | Original record |
| Falcon-H1R-7BTII UAE | 72.38% | Original record |
SciCode / MiniMax report7 results
Scientific programming tasks.
| Model and configuration | Score | Source |
|---|---|---|
| Gemini 3 Pro (MiniMax internal evaluation)Google | 56 | Original record |
| Claude Opus 4.6 (MiniMax internal evaluation)Anthropic | 52 | Original record |
| GPT-5.2 (Thinking; MiniMax internal evaluation)OpenAI | 52 | Original record |
| Claude Opus 4.5 (MiniMax internal evaluation)Anthropic | 50 | Original record |
| Claude Sonnet 4.5 (MiniMax internal evaluation)Anthropic | 45 | Original record |
| MiniMax-M2.5 (MiniMax internal evaluation)MiniMax | 44.4 | Original record |
| MiniMax-M2.1 (MiniMax internal evaluation)MiniMax | 41 | Original record |
Terminal Bench 2.1 / DeepSeek GA report8 results
Coding and tool use in terminal tasks.
| Model and configuration | Score | Source |
|---|---|---|
| Kimi K3 (Code-agent evaluation; harness and reasoning effort not disclosed for this model)Moonshot AI | 88.3 | Original record |
| Fable-5 (w/ fallback) (Code-agent evaluation; harness and reasoning effort not disclosed for this model; with fallback, details unspecified)Anthropic | 88 | Original record |
| DeepSeek-V4-Pro-0813 (DeepSeek Harness minimal; max reasoning effort; temperature=1.0; top_p=0.95)DeepSeek | 87.9 | Original record |
| Opus-4.8 (Code-agent evaluation; harness and reasoning effort not disclosed for this model)Anthropic | 85 | Original record |
| DeepSeek-V4-Flash-0731 (Code-agent evaluation; harness and reasoning effort not disclosed for this model)DeepSeek | 82.7 | Original record |
| GLM-5.2 (Code-agent evaluation; harness and reasoning effort not disclosed for this model)Z.ai | 81 | Original record |
| DeepSeek-V4-Pro (Preview) (Code-agent evaluation; harness and reasoning effort not disclosed for this model)DeepSeek | 72.1 | Original record |
| DeepSeek-V4-Flash (Preview) (Code-agent evaluation; harness and reasoning effort not disclosed for this model)DeepSeek | 61.8 | Original record |
SWE-bench Pro refined set / Qwen3.8-Max report5 results
Code fixes on Qwen's corrected SWE-bench Pro evaluation set.
- Fable 580
- Opus 4.869.2
- Qwen3.8-Max67.7
- GPT 5.6 Sol (max)64.6
- Qwen3.7-Max60.6
| Model and configuration | Score | Source |
|---|---|---|
| Fable 5 (Qwen-refined set; Claude Code; temperature=1.0; top_p=0.95; 256K context; may involve fallback; reasoning effort not disclosed)Anthropic | 80 | Original record |
| Opus 4.8 (Qwen-refined set; Claude Code; temperature=1.0; top_p=0.95; 256K context; reasoning effort not disclosed)Anthropic | 69.2 | Original record |
| Qwen3.8-Max service model; Qwen-refined set; Claude Code; temperature=1.0; top_p=0.95; 256K context; reasoning effort not disclosedQwen | 67.7 | Original record |
| GPT 5.6 Sol (max) (Qwen-refined set; Claude Code; max (table header); temperature=1.0; top_p=0.95; 256K context)OpenAI | 64.6 | Original record |
| Qwen3.7-Max (Qwen-refined set; Claude Code; temperature=1.0; top_p=0.95; 256K context; reasoning effort not disclosed)Qwen | 60.6 | Original record |
SWE-bench Verified / Google G31 (2026-02-19)5 results
Repository issue resolution by a model and its coding-agent environment.
- Claude Opus 4.680.8%
- Gemini 3.1 Pro80.6%
- GPT-5.280%
- Claude Sonnet 4.679.6%
- Gemini 3 Pro76.2%
| Model and configuration | Score | Source |
|---|---|---|
| Claude Opus 4.6 (Thinking (Max); Single attempt; provider-specific scaffolding)Anthropic | 80.8% | Original record |
| Gemini 3.1 Pro (Thinking (High); Single attempt; provider-specific scaffolding)Google | 80.6% | Original record |
| GPT-5.2 (Thinking (xhigh); Single attempt; provider-specific scaffolding)OpenAI | 80% | Original record |
| Claude Sonnet 4.6 (Thinking (Max); Single attempt; provider-specific scaffolding)Anthropic | 79.6% | Original record |
| Gemini 3 Pro (Thinking (High); Single attempt; provider-specific scaffolding)Google | 76.2% | Original record |
SWE-bench Pro (Public) / Google G31 (2026-02-19)4 results
Public SWE-bench Pro software-engineering tasks.
- GPT-5.3-Codex56.8%
- GPT-5.255.6%
- Gemini 3.1 Pro54.2%
- Gemini 3 Pro43.3%
| Model and configuration | Score | Source |
|---|---|---|
| GPT-5.3-Codex (Thinking (xhigh); Public split; single attempt; provider-specific scaffolding)OpenAI | 56.8% | Original record |
| GPT-5.2 (Thinking (xhigh); Public split; single attempt; provider-specific scaffolding)OpenAI | 55.6% | Original record |
| Gemini 3.1 Pro (Thinking (High); Public split; single attempt; provider-specific scaffolding)Google | 54.2% | Original record |
| Gemini 3 Pro (Thinking (High); Public split; single attempt; provider-specific scaffolding)Google | 43.3% | Original record |
Model reasoning
Intelligence Index v4.215 results
Ten-evaluation composite
- Claude Fable 5.156.76
- GPT-6 Astra54.66
- Claude Opus 554.05
- Claude Fable 553.19
- Muse Spark 1.352.95
- GPT-5.6 Sol51.26
- Grok 4.650.58
- Kimi K350.23
- GLM-5.348.58
- Gemini 3.8 Flash47.07
- Qwen3.8 Max46.91
- Muse Spark 1.246.84
- GPT-5.6 Terra46.77
- Qwen3.8 2.4T A95B46.74
- GLM 5.3 Flash46.22
| Model and configuration | Score | Source |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 56.76 | Original record |
| GPT-6 Astra (max)OpenAI | 54.66 | Original record |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 54.05 | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 53.19 | Original record |
| Muse Spark 1.3 (max)Meta | 52.95 | Original record |
| GPT-5.6 Sol (max)OpenAI | 51.26 | Original record |
| Grok 4.6 (high)SpaceXAI | 50.58 | Original record |
| Kimi K3 (max)Kimi | 50.23 | Original record |
| GLM-5.3 (max)Z AI | 48.58 | Original record |
| Gemini 3.8 Flash (high)Google | 47.07 | Original record |
| Qwen3.8 MaxAlibaba | 46.91 | Original record |
| Muse Spark 1.2 (xhigh)Meta | 46.84 | Original record |
| GPT-5.6 Terra (max)OpenAI | 46.77 | Original record |
| Qwen3.8 2.4T A95BAlibaba | 46.74 | Original record |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 46.22 | Original record |
Humanity's Last Exam15 results
Expert-level reasoning and knowledge
- Claude Fable 5.159.13%
- Claude Fable 555.47%
- Claude Opus 554.87%
- GPT-6 Astra54.68%
- GPT-5.6 Sol49.49%
- Muse Spark 1.349.07%
- Gemini 3.7 Flash47.87%
- Gemini 3.8 Flash47.82%
- Gemini 3.1 Pro Preview47.03%
- Kimi K346.9%
- Muse Spark 1.245.46%
- Grok 4.644.07%
- Qwen3.8 Max43.05%
- GPT-5.6 Terra42.91%
- Grok 4.542.68%
| Model and configuration | Score | Source |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 59.13% | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 55.47% | Original record |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 54.87% | Original record |
| GPT-6 Astra (max)OpenAI | 54.68% | Original record |
| GPT-5.6 Sol (max)OpenAI | 49.49% | Original record |
| Muse Spark 1.3 (max)Meta | 49.07% | Original record |
| Gemini 3.7 Flash (high)Google | 47.87% | Original record |
| Gemini 3.8 Flash (high)Google | 47.82% | Original record |
| Gemini 3.1 Pro PreviewGoogle | 47.03% | Original record |
| Kimi K3 (max)Kimi | 46.9% | Original record |
| Muse Spark 1.2 (xhigh)Meta | 45.46% | Original record |
| Grok 4.6 (xhigh)SpaceXAI | 44.07% | Original record |
| Qwen3.8 MaxAlibaba | 43.05% | Original record |
| GPT-5.6 Terra (max)OpenAI | 42.91% | Original record |
| Grok 4.5 (high)SpaceXAI | 42.68% | Original record |
GPQA Diamond15 results
Graduate-level science
- GPT-6 Astra96.26%
- Gemini 3.8 Flash95.25%
- Grok 4.694.95%
- Gemini 3.7 Flash94.55%
- Gemini 3.1 Pro Preview94.14%
- Muse Spark 1.394.14%
- GPT-5.6 Sol94.14%
- Claude Opus 593.74%
- Claude Fable 5.193.74%
- Qwen3.8 2.4T A95B93.54%
- Kimi K393.54%
- Grok 4.593.13%
- MiniMax-M392.93%
- Gemini 3.6 Flash92.83%
- DeepSeek V4 Pro 081392.83%
| Model and configuration | Score | Source |
|---|---|---|
| GPT-6 Astra (xhigh)OpenAI | 96.26% | Original record |
| Gemini 3.8 Flash (high)Google | 95.25% | Original record |
| Grok 4.6 (high)SpaceXAI | 94.95% | Original record |
| Gemini 3.7 Flash (high)Google | 94.55% | Original record |
| Gemini 3.1 Pro PreviewGoogle | 94.14% | Original record |
| Muse Spark 1.3 (xhigh)Meta | 94.14% | Original record |
| GPT-5.6 Sol (max)OpenAI | 94.14% | Original record |
| Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic | 93.74% | Original record |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 93.74% | Original record |
| Qwen3.8 2.4T A95BAlibaba | 93.54% | Original record |
| Kimi K3 (max)Kimi | 93.54% | Original record |
| Grok 4.5 (high)SpaceXAI | 93.13% | Original record |
| MiniMax-M3MiniMax | 92.93% | Original record |
| Gemini 3.6 Flash (high)Google | 92.83% | Original record |
| DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek | 92.83% | Original record |
CritPt15 results
Research-level physics
- GPT-5.6 Sol32.29%
- GPT-6 Astra31.71%
- Claude Fable 5.131.14%
- GPT-5.5 Pro30.57%
- GPT-5.6 Terra30%
- Claude Opus 529.14%
- Claude Fable 528.57%
- Muse Spark 1.326%
- Gemini 3 Deep Think25.71%
- Kimi K323.43%
- GLM-5.220.86%
- GPT-5.6 Luna20.57%
- Qwen3.8 Max20%
- Qwen3.8 2.4T A95B20%
- Grok 4.619.71%
| Model and configuration | Score | Source |
|---|---|---|
| GPT-5.6 Sol (max)OpenAI | 32.29% | Original record |
| GPT-6 Astra (max)OpenAI | 31.71% | Original record |
| Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropic | 31.14% | Original record |
| GPT-5.5 Pro (xhigh)OpenAI | 30.57% | Original record |
| GPT-5.6 Terra (max)OpenAI | 30% | Original record |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 29.14% | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 28.57% | Original record |
| Muse Spark 1.3 (xhigh)Meta | 26% | Original record |
| Gemini 3 Deep ThinkGoogle | 25.71% | Original record |
| Kimi K3 (max)Kimi | 23.43% | Original record |
| GLM-5.2 (max)Z AI | 20.86% | Original record |
| GPT-5.6 Luna (max)OpenAI | 20.57% | Original record |
| Qwen3.8 MaxAlibaba | 20% | Original record |
| Qwen3.8 2.4T A95BAlibaba | 20% | Original record |
| Grok 4.6 (xhigh)SpaceXAI | 19.71% | Original record |
AIME 202515 results
Competition mathematics
- Nova 2.0 Lite94.33%
- gpt-oss-120b93.44%
- NVIDIA Nemotron 3 Nano 30B A3B91%
- K-EXAONE90.33%
- Nova 2.0 Omni89.67%
- gpt-oss-20b89.33%
- Nova 2.0 Pro Preview89%
- o388.33%
- INTELLECT-388%
- Apriel-v1.6-15B-Thinker88%
- ERNIE 5.0 Thinking Preview85%
- Qwen3 Next 80B A3B (Reasoning)84.33%
- Ring-flash-2.083.67%
- Claude 4.5 Haiku83.67%
- Magistral Medium 1.282%
| Model and configuration | Score | Source |
|---|---|---|
| Nova 2.0 Lite (high)Amazon | 94.33% | Original record |
| gpt-oss-120b (high)OpenAI | 93.44% | Original record |
| NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)NVIDIA | 91% | Original record |
| K-EXAONE (Reasoning)LG AI Research | 90.33% | Original record |
| Nova 2.0 Omni (medium)Amazon | 89.67% | Original record |
| gpt-oss-20b (high)OpenAI | 89.33% | Original record |
| Nova 2.0 Pro Preview (medium)Amazon | 89% | Original record |
| o3OpenAI | 88.33% | Original record |
| INTELLECT-3Prime Intellect | 88% | Original record |
| Apriel-v1.6-15B-ThinkerServiceNow | 88% | Original record |
| ERNIE 5.0 Thinking PreviewBaidu | 85% | Original record |
| Qwen3 Next 80B A3B (Reasoning)Alibaba | 84.33% | Original record |
| Ring-flash-2.0InclusionAI | 83.67% | Original record |
| Claude 4.5 Haiku (Reasoning)Anthropic | 83.67% | Original record |
| Magistral Medium 1.2Mistral | 82% | Original record |
IFBench15 results
Instruction following
- Grok 4.383.33%
- MiniMax-M382.86%
- Nemotron 3 Ultra 550B A55B81.36%
- Nemotron Cascade 2 30B A3B80.41%
- MiMo-V2.5-Pro79.86%
- Nova 2.0 Pro Preview79.59%
- Qwen3.5 397B A17B78.78%
- Qwen3.7 Plus77.96%
- Gemini 3.1 Pro Preview77.14%
- DeepSeek V4 Pro 042476.46%
- Qwen3.5 122B A10B75.71%
- Gemma 4 31B75.58%
- GPT-5.3 Codex75.37%
- Gemini 3.5 Flash74.56%
- Command A+73.95%
| Model and configuration | Score | Source |
|---|---|---|
| Grok 4.3 (medium)SpaceXAI | 83.33% | Original record |
| MiniMax-M3MiniMax | 82.86% | Original record |
| Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA | 81.36% | Original record |
| Nemotron Cascade 2 30B A3BNVIDIA | 80.41% | Original record |
| MiMo-V2.5-ProXiaomi | 79.86% | Original record |
| Nova 2.0 Pro Preview (low)Amazon | 79.59% | Original record |
| Qwen3.5 397B A17B (Reasoning)Alibaba | 78.78% | Original record |
| Qwen3.7 PlusAlibaba | 77.96% | Original record |
| Gemini 3.1 Pro PreviewGoogle | 77.14% | Original record |
| DeepSeek V4 Pro 0424 (DeepSeek V4 Pro (Reasoning, Max Effort))DeepSeek | 76.46% | Original record |
| Qwen3.5 122B A10B (Reasoning)Alibaba | 75.71% | Original record |
| Gemma 4 31B (Reasoning)Google | 75.58% | Original record |
| GPT-5.3 Codex (xhigh)OpenAI | 75.37% | Original record |
| Gemini 3.5 Flash (medium)Google | 74.56% | Original record |
| Command A+Cohere | 73.95% | Original record |
LongBench v2 / Moonshot report5 results
Reading and reasoning over long inputs.
- Gemini 3 Pro68.2
- Claude Opus 4.564.4
- Kimi K2.561
- DeepSeek V3.259.8
- GPT-5.254.5
| Model and configuration | Score | Source |
|---|---|---|
| Gemini 3 Pro (High Thinking Level; publisher rerun (*))Google | 68.2 | Original record |
| Claude Opus 4.5 (Extended Thinking; publisher rerun (*))Anthropic | 64.4 | Original record |
| Kimi K2.5 (Thinking)Moonshot AI | 61 | Original record |
| DeepSeek V3.2 (Thinking; publisher rerun (*))DeepSeek | 59.8 | Original record |
| GPT-5.2 (xhigh; publisher rerun (*))OpenAI | 54.5 | Original record |
AIME 2026 I / Z.ai report6 results
The first 2026 AIME exam, not the combined 2026 set.
- Claude Opus 4.593.3
- GLM-4.792.9
- GLM-592.7
- DeepSeek V3.292.7
- Kimi K2.592.5
- Gemini 3 Pro90.6
| Model and configuration | Score | Source |
|---|---|---|
| Claude Opus 4.5 (GLM-5 release comparison)Anthropic | 93.3 | Original record |
| GLM-4.7 (GLM-5 release comparison)Z.ai | 92.9 | Original record |
| GLM-5 release reportZ.ai | 92.7 | Original record |
| DeepSeek V3.2 (GLM-5 release comparison)DeepSeek | 92.7 | Original record |
| Kimi K2.5 (GLM-5 release comparison)Moonshot AI | 92.5 | Original record |
| Gemini 3 Pro (GLM-5 release comparison)Google | 90.6 | Original record |
HMMT November 2025 / Z.ai report7 results
The November 2025 mathematics competition.
- GPT-5.297.1
- GLM-596.9
- GLM-4.793.5
- Gemini 3 Pro93
- Claude Opus 4.591.7
- Kimi K2.591.1
- DeepSeek V3.290.2
| Model and configuration | Score | Source |
|---|---|---|
| GPT-5.2 (xhigh)OpenAI | 97.1 | Original record |
| GLM-5 release reportZ.ai | 96.9 | Original record |
| GLM-4.7 (GLM-5 release comparison)Z.ai | 93.5 | Original record |
| Gemini 3 Pro (GLM-5 release comparison)Google | 93 | Original record |
| Claude Opus 4.5 (GLM-5 release comparison)Anthropic | 91.7 | Original record |
| Kimi K2.5 (GLM-5 release comparison)Moonshot AI | 91.1 | Original record |
| DeepSeek V3.2 (GLM-5 release comparison)DeepSeek | 90.2 | Original record |
AA-LCR / MiniMax report7 results
Reasoning across long inputs.
| Model and configuration | Score | Source |
|---|---|---|
| Claude Opus 4.5 (MiniMax internal evaluation)Anthropic | 74 | Original record |
| GPT-5.2 (Thinking; MiniMax internal evaluation)OpenAI | 73 | Original record |
| Claude Opus 4.6 (MiniMax internal evaluation)Anthropic | 71 | Original record |
| Gemini 3 Pro (MiniMax internal evaluation)Google | 71 | Original record |
| MiniMax-M2.5 (MiniMax internal evaluation)MiniMax | 69.5 | Original record |
| Claude Sonnet 4.5 (MiniMax internal evaluation)Anthropic | 66 | Original record |
| MiniMax-M2.1 (MiniMax internal evaluation)MiniMax | 62 | Original record |
HLE no tools / DeepSeek GA report8 results
Reasoning across disciplines without tools.
| Model and configuration | Score | Source |
|---|---|---|
| Fable-5 (w/ fallback) (No tools; HLE reasoning effort and token budget not disclosed; with fallback, details unspecified)Anthropic | 53.3 | Original record |
| Opus-4.8 (No tools; HLE reasoning effort and token budget not disclosed)Anthropic | 49.8 | Original record |
| Kimi K3 (No tools; HLE reasoning effort and token budget not disclosed)Moonshot AI | 43.5 | Original record |
| DeepSeek-V4-Pro-0813 (No tools; HLE reasoning effort and token budget not disclosed)DeepSeek | 42.7 | Original record |
| GLM-5.2 (No tools; HLE reasoning effort and token budget not disclosed)Z.ai | 40.5 | Original record |
| DeepSeek-V4-Flash-0731 (No tools; HLE reasoning effort and token budget not disclosed)DeepSeek | 37.8 | Original record |
| DeepSeek-V4-Pro (Preview) (No tools; HLE reasoning effort and token budget not disclosed)DeepSeek | 37.7 | Original record |
| DeepSeek-V4-Flash (Preview) (No tools; HLE reasoning effort and token budget not disclosed)DeepSeek | 34.8 | Original record |
HLE with tools / DeepSeek GA report8 results
Reasoning across disciplines with tools.
| Model and configuration | Score | Source |
|---|---|---|
| Fable-5 (w/ fallback) (With tools; specific tools, HLE reasoning effort and token budget not disclosed; with fallback, details unspecified)Anthropic | 63 | Original record |
| DeepSeek-V4-Pro-0813 (With tools; specific tools, HLE reasoning effort and token budget not disclosed)DeepSeek | 60 | Original record |
| Opus-4.8 (With tools; specific tools, HLE reasoning effort and token budget not disclosed)Anthropic | 57.9 | Original record |
| Kimi K3 (With tools; specific tools, HLE reasoning effort and token budget not disclosed)Moonshot AI | 56 | Original record |
| GLM-5.2 (With tools; specific tools, HLE reasoning effort and token budget not disclosed)Z.ai | 54.7 | Original record |
| DeepSeek-V4-Flash-0731 (With tools; specific tools, HLE reasoning effort and token budget not disclosed)DeepSeek | 51.5 | Original record |
| DeepSeek-V4-Pro (Preview) (With tools; specific tools, HLE reasoning effort and token budget not disclosed)DeepSeek | 48.2 | Original record |
| DeepSeek-V4-Flash (Preview) (With tools; specific tools, HLE reasoning effort and token budget not disclosed)DeepSeek | 45.1 | Original record |
HMMT February 2026 / DeepSeek Preview report6 results
Mathematics competition problems, measured by Pass@1.
- GPT-5.4 xHigh97.7%
- Opus-4.6 Max96.2%
- DS-V4-Pro Max95.2%
- Gemini-3.1-Pro High94.7%
- K2.6 Thinking92.7%
- GLM-5.1 Thinking89.4%
| Model and configuration | Score | Source |
|---|---|---|
| GPT-5.4 xHigh (xHigh; DeepSeek Preview report comparison)OpenAI | 97.7% | Original record |
| Opus-4.6 Max (Max; DeepSeek Preview report comparison)Anthropic | 96.2% | Original record |
| DS-V4-Pro Max (Preview; Max; temperature=1.0; 384K-token context; distinct rigorous-proof math prompt)DeepSeek | 95.2% | Original record |
| Gemini-3.1-Pro High (High; DeepSeek Preview report comparison)Google | 94.7% | Original record |
| K2.6 Thinking (Thinking; DeepSeek Preview report comparison)Moonshot AI | 92.7% | Original record |
| GLM-5.1 Thinking (Thinking; DeepSeek Preview report comparison)Z.ai | 89.4% | Original record |
LongBench v2 / Qwen3.8-Max report4 results
Reading and reasoning over long documents and inputs.
- Opus 4.869.1
- GPT 5.6 Sol (max)67.1
- Qwen3.8-Max66.3
- Qwen3.7-Max65.3
| Model and configuration | Score | Source |
|---|---|---|
| Opus 4.8 (LongBench v2; tools, reasoning effort and token budget not disclosed)Anthropic | 69.1 | Original record |
| GPT 5.6 Sol (max) (max (table header); LongBench v2 tools and token budget not disclosed)OpenAI | 67.1 | Original record |
| Qwen3.8-Max service model; LongBench v2 tools, reasoning effort and token budget not disclosedQwen | 66.3 | Original record |
| Qwen3.7-Max (LongBench v2; tools, reasoning effort and token budget not disclosed)Qwen | 65.3 | Original record |
GPQA Diamond / Google G31 (2026-02-19)5 results
Scientific knowledge and reasoning without tools.
- Gemini 3.1 Pro94.3%
- GPT-5.292.4%
- Gemini 3 Pro91.9%
- Claude Opus 4.691.3%
- Claude Sonnet 4.689.9%
| Model and configuration | Score | Source |
|---|---|---|
| Gemini 3.1 Pro (Thinking (High); No tools)Google | 94.3% | Original record |
| GPT-5.2 (Thinking (xhigh); No tools)OpenAI | 92.4% | Original record |
| Gemini 3 Pro (Thinking (High); No tools)Google | 91.9% | Original record |
| Claude Opus 4.6 (Thinking (Max); No tools)Anthropic | 91.3% | Original record |
| Claude Sonnet 4.6 (Thinking (Max); No tools)Anthropic | 89.9% | Original record |
HLE, no tools / Google G31 (2026-02-19)5 results
Expert-level reasoning on the full text and multimodal HLE set without tools.
- Gemini 3.1 Pro44.4%
- Claude Opus 4.640%
- Gemini 3 Pro37.5%
- GPT-5.234.5%
- Claude Sonnet 4.633.2%
| Model and configuration | Score | Source |
|---|---|---|
| Gemini 3.1 Pro (Thinking (High); No tools)Google | 44.4% | Original record |
| Claude Opus 4.6 (Thinking (Max); No tools)Anthropic | 40% | Original record |
| Gemini 3 Pro (Thinking (High); No tools)Google | 37.5% | Original record |
| GPT-5.2 (Thinking (xhigh); No tools)OpenAI | 34.5% | Original record |
| Claude Sonnet 4.6 (Thinking (Max); No tools)Anthropic | 33.2% | Original record |
HLE, search and code / Google G31 (2026-02-19)5 results
Expert-level HLE reasoning with search and code execution.
- Claude Opus 4.653.1%
- Gemini 3.1 Pro51.4%
- Claude Sonnet 4.649%
- Gemini 3 Pro45.8%
- GPT-5.245.5%
| Model and configuration | Score | Source |
|---|---|---|
| Claude Opus 4.6 (Thinking (Max); Search and code; provider-specific tools)Anthropic | 53.1% | Original record |
| Gemini 3.1 Pro (Thinking (High); Search and code; provider-specific tools)Google | 51.4% | Original record |
| Claude Sonnet 4.6 (Thinking (Max); Search and code; provider-specific tools)Anthropic | 49% | Original record |
| Gemini 3 Pro (Thinking (High); Search and code; provider-specific tools)Google | 45.8% | Original record |
| GPT-5.2 (Thinking (xhigh); Search and code; provider-specific tools)OpenAI | 45.5% | Original record |
ARC-AGI-2 / Google G31 (2026-02-19)5 results
Inferring unfamiliar patterns from example grids.
- Gemini 3.1 Pro77.1%
- Claude Opus 4.668.8%
- Claude Sonnet 4.658.3%
- GPT-5.252.9%
- Gemini 3 Pro31.1%
| Model and configuration | Score | Source |
|---|---|---|
| Gemini 3.1 Pro (Thinking (High); ARC Prize Verified; semi-private set)Google | 77.1% | Original record |
| Claude Opus 4.6 (Thinking (Max); ARC Prize Verified; semi-private set)Anthropic | 68.8% | Original record |
| Claude Sonnet 4.6 (Thinking (Max); ARC Prize Verified; semi-private set)Anthropic | 58.3% | Original record |
| GPT-5.2 (Thinking (xhigh); ARC Prize Verified; semi-private set)OpenAI | 52.9% | Original record |
| Gemini 3 Pro (Thinking (High); ARC Prize Verified; semi-private set)Google | 31.1% | Original record |
AIME 2025, no tools / Google G3F (2025-12-17)7 results
Mathematics from the 2025 AIME competition.
- GPT-5.2100%
- Gemini 3 Flash95.2%
- Gemini 3 Pro95%
- Grok 4.1 Fast91.9%
- Gemini 2.5 Pro88%
- Claude Sonnet 4.587%
- Gemini 2.5 Flash72%
| Model and configuration | Score | Source |
|---|---|---|
| GPT-5.2 (Extra high; No tools)OpenAI | 100% | Original record |
| Gemini 3 Flash (Thinking; exact level unspecified; No tools)Google | 95.2% | Original record |
| Gemini 3 Pro (Thinking; exact level unspecified; No tools)Google | 95% | Original record |
| Grok 4.1 Fast (Reasoning; No tools)xAI | 91.9% | Original record |
| Gemini 2.5 Pro (Thinking; exact level unspecified; No tools)Google | 88% | Original record |
| Claude Sonnet 4.5 (Thinking; high preferred, otherwise best available reported setting; No tools)Anthropic | 87% | Original record |
| Gemini 2.5 Flash (Thinking; exact level unspecified; No tools)Google | 72% | Original record |
AIME 2025, code execution / Google G3F (2025-12-17)4 results
Mathematics from the 2025 AIME competition.
- Gemini 3 Pro100%
- Claude Sonnet 4.5100%
- Gemini 3 Flash99.7%
- Gemini 2.5 Flash75.7%
| Model and configuration | Score | Source |
|---|---|---|
| Gemini 3 Pro (Thinking; exact level unspecified; Code execution)Google | 100% | Original record |
| Claude Sonnet 4.5 (Thinking; high preferred, otherwise best available reported setting; Code execution)Anthropic | 100% | Original record |
| Gemini 3 Flash (Thinking; exact level unspecified; Code execution)Google | 99.7% | Original record |
| Gemini 2.5 Flash (Thinking; exact level unspecified; Code execution)Google | 75.7% | Original record |
HLE, no tools / Anthropic A51 (2026-09-01)3 results
Original HLE reasoning on 2,500 multimodal questions without tools.
- Claude Fable 5.160.9%
- Claude Fable 557.8%
- Claude Opus 556.6%
| Model and configuration | Score | Source |
|---|---|---|
| Claude Fable 5.1 (Adaptive thinking (auto); max effort; default sampling; five-trial mean; total token cap 1M; no compaction; production safeguards enabled; No tools)Anthropic | 60.9% | Original record |
| Claude Fable 5 (Detailed reasoning setting and budget unverified; production safeguards enabled; No tools)Anthropic | 57.8% | Original record |
| Claude Opus 5 (Detailed reasoning setting and budget unverified; No tools)Anthropic | 56.6% | Original record |
HLE, tools / Anthropic A51 (2026-09-01)3 results
Original HLE reasoning with search, web retrieval and code tools.
- Claude Fable 5.165%
- Claude Fable 563.8%
- Claude Opus 563.6%
| Model and configuration | Score | Source |
|---|---|---|
| Claude Fable 5.1 (Adaptive thinking (auto); max effort; default sampling; five-trial mean; total token cap 1M; no compaction; production safeguards enabled; Search; restricted fetch; programmatic tool calling; code execution)Anthropic | 65% | Original record |
| Claude Fable 5 (Detailed reasoning setting and budget unverified; production safeguards enabled; Search; restricted fetch; programmatic tool calling; code execution)Anthropic | 63.8% | Original record |
| Claude Opus 5 (Detailed reasoning setting and budget unverified; Search; restricted fetch; programmatic tool calling; code execution)Anthropic | 63.6% | Original record |
ARC-AGI-2 / Anthropic A51 (2026-09-01)4 results
Novel grid-pattern reasoning in the September release comparison.
| Model and configuration | Score | Source |
|---|---|---|
| GPT-5.6 Sol (Exact reasoning setting and token budget unverified)OpenAI | 92.5% | Original record |
| Claude Opus 5 (Exact reasoning setting and token budget unverified)Anthropic | 90.42% | Original record |
| Claude Fable 5.1 / Claude Mythos 5.1 (Fable 5.1: max effort; semi-private set; ARC Prize Verified)Anthropic | 90% | Original record |
| Claude Fable 5 / Claude Mythos 5 (Exact reasoning setting and token budget unverified)Anthropic | 89.2% | Original record |
HLE-Verified / Google G38 (2026-09-02)6 results
Expert reasoning on a verified and revised 1,811-question set.
- Gemini 3.8 Flash54.9%
- GPT-5.6 Sol54.5%
- Claude Opus 554.4%
- Gemini 3.7 Flash53.6%
- GPT-5.6 Terra51.1%
- Claude Sonnet 531%
| Model and configuration | Score | Source |
|---|---|---|
| Gemini 3.8 Flash (Default sampling; exact thinking level unspecified; HLE-Verified; 1811 items; tool use unspecified)Google | 54.9% | Original record |
| GPT-5.6 Sol (Exact reasoning level unspecified; HLE-Verified; 1811 items; tool use unspecified)OpenAI | 54.5% | Original record |
| Claude Opus 5 (Exact thinking level unspecified; HLE-Verified; 1811 items; tool use unspecified)Anthropic | 54.4% | Original record |
| Gemini 3.7 Flash (Exact thinking level unspecified; HLE-Verified; 1811 items; tool use unspecified)Google | 53.6% | Original record |
| GPT-5.6 Terra (Maximum reasoning preferred; otherwise best available reported setting; HLE-Verified; 1811 items; tool use unspecified)OpenAI | 51.1% | Original record |
| Claude Sonnet 5 (Maximum thinking preferred; otherwise best available reported setting; HLE-Verified; 1811 items; tool use unspecified)Anthropic | 31% | Original record |
Documents and context
AA-LCR v1.115 results
Long-context reasoning
- Kimi K388.67%
- Claude Fable 5.185.33%
- Muse Spark 1.384.33%
- Gemini 3.8 Flash84%
- GPT-5.6 Sol84%
- GPT-5.6 Luna83.67%
- Muse Glimmer83.33%
- GPT-5.3 Codex83.33%
- MiniMax-M383%
- GPT-5.6 Terra83%
- Gemini 3.7 Flash83%
- Agnes 2.5 Pro Beta83%
- Claude Fable 582.33%
- Claude Sonnet 582%
- Qwen3.8 27B82%
| Model and configuration | Score | Source |
|---|---|---|
| Kimi K3 (max)Kimi | 88.67% | Original record |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 85.33% | Original record |
| Muse Spark 1.3 (max)Meta | 84.33% | Original record |
| Gemini 3.8 Flash (medium)Google | 84% | Original record |
| GPT-5.6 Sol (max)OpenAI | 84% | Original record |
| GPT-5.6 Luna (max)OpenAI | 83.67% | Original record |
| Muse Glimmer (high)Meta | 83.33% | Original record |
| GPT-5.3 Codex (xhigh)OpenAI | 83.33% | Original record |
| MiniMax-M3MiniMax | 83% | Original record |
| GPT-5.6 Terra (max)OpenAI | 83% | Original record |
| Gemini 3.7 Flash (medium)Google | 83% | Original record |
| Agnes 2.5 Pro BetaSapiens AI | 83% | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 82.33% | Original record |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 82% | Original record |
| Qwen3.8 27B (xhigh)Alibaba | 82% | Original record |
MMMU-Pro15 results
Visual reasoning
- GPT-6 Astra86.88%
- Gemini 3.8 Flash85.61%
- Gemini 3.7 Flash85.49%
- Claude Opus 584.74%
- Gemini 3.5 Flash83.87%
- GPT-5.6 Sol83.41%
- Gemini 3.6 Flash83.24%
- Gemini 3.1 Pro Preview82.43%
- Qwen3.8 Max82.31%
- Muse Spark 1.382.02%
- GPT-5.6 Terra80.69%
- Kimi K380.52%
- Qwen3.7 Plus80.46%
- Grok 4.580.4%
- Qwen3.8-Flash-Next79.77%
| Model and configuration | Score | Source |
|---|---|---|
| GPT-6 Astra (max)OpenAI | 86.88% | Original record |
| Gemini 3.8 Flash (high)Google | 85.61% | Original record |
| Gemini 3.7 Flash (high)Google | 85.49% | Original record |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 84.74% | Original record |
| Gemini 3.5 Flash (medium)Google | 83.87% | Original record |
| GPT-5.6 Sol (max)OpenAI | 83.41% | Original record |
| Gemini 3.6 Flash (high)Google | 83.24% | Original record |
| Gemini 3.1 Pro PreviewGoogle | 82.43% | Original record |
| Qwen3.8 MaxAlibaba | 82.31% | Original record |
| Muse Spark 1.3 (xhigh)Meta | 82.02% | Original record |
| GPT-5.6 Terra (max)OpenAI | 80.69% | Original record |
| Kimi K3 (max)Kimi | 80.52% | Original record |
| Qwen3.7 PlusAlibaba | 80.46% | Original record |
| Grok 4.5 (high)SpaceXAI | 80.4% | Original record |
| Qwen3.8-Flash-NextAlibaba | 79.77% | Original record |
AA-Omniscience / Index15 results
Knowledge reliability
- GPT-6 Astra43.73
- Claude Fable 5.143.45
- Claude Fable 543.3
- Claude Opus 537.07
- Gemini 3.1 Pro Preview31.88
- Grok 4.630.48
- Gemini 3.8 Flash29.55
- Muse Spark 1.227.2
- Gemini 3.7 Flash26.48
- Grok 4.525.32
- Muse Spark 1.324.93
- Gemini 3.6 Flash22.13
- GPT-5.6 Sol21.97
- Gemini 3.5 Flash20.82
- Kimi K319.7
| Model and configuration | Score | Source |
|---|---|---|
| GPT-6 Astra (high)OpenAI | 43.73 | Original record |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 43.45 | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 43.3 | Original record |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 37.07 | Original record |
| Gemini 3.1 Pro PreviewGoogle | 31.88 | Original record |
| Grok 4.6 (high)SpaceXAI | 30.48 | Original record |
| Gemini 3.8 Flash (high)Google | 29.55 | Original record |
| Muse Spark 1.2 (xhigh)Meta | 27.2 | Original record |
| Gemini 3.7 Flash (high)Google | 26.48 | Original record |
| Grok 4.5 (high)SpaceXAI | 25.32 | Original record |
| Muse Spark 1.3 (max)Meta | 24.93 | Original record |
| Gemini 3.6 Flash (high)Google | 22.13 | Original record |
| GPT-5.6 Sol (max)OpenAI | 21.97 | Original record |
| Gemini 3.5 Flash (medium)Google | 20.82 | Original record |
| Kimi K3 (max)Kimi | 19.7 | Original record |
AA-Omniscience / Accuracy15 results
Correct knowledge answers
- Claude Fable 5.167.23%
- Claude Fable 565.35%
- GPT-6 Astra62.6%
- Claude Opus 560.87%
- GPT-5.6 Sol59.4%
- Gemini 3.7 Flash55.32%
- Gemini 3.1 Pro Preview54.85%
- Gemini 3.8 Flash54.6%
- GPT-5.3 Codex52.88%
- Grok 4.551.55%
- Gemini 3.5 Flash51.05%
- Gemini 3.6 Flash49.97%
- DeepSeek V4 Pro 081349.1%
- Grok 4.648.23%
- Kimi K347.58%
| Model and configuration | Score | Source |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 67.23% | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 65.35% | Original record |
| GPT-6 Astra (max)OpenAI | 62.6% | Original record |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 60.87% | Original record |
| GPT-5.6 Sol (max)OpenAI | 59.4% | Original record |
| Gemini 3.7 Flash (high)Google | 55.32% | Original record |
| Gemini 3.1 Pro PreviewGoogle | 54.85% | Original record |
| Gemini 3.8 Flash (high)Google | 54.6% | Original record |
| GPT-5.3 Codex (xhigh)OpenAI | 52.88% | Original record |
| Grok 4.5 (high)SpaceXAI | 51.55% | Original record |
| Gemini 3.5 Flash (medium)Google | 51.05% | Original record |
| Gemini 3.6 Flash (high)Google | 49.97% | Original record |
| DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek | 49.1% | Original record |
| Grok 4.6 (high)SpaceXAI | 48.23% | Original record |
| Kimi K3 (max)Kimi | 47.58% | Original record |
AA-Omniscience / Hallucination15 results
Hallucination rate, lower is better
- MiniCPM5-1B0.9%
- G9v3-3B11.66%
- G9v3-39A5B13.04%
- Command A+14.16%
- LFM2.5-2.6B16%
- Grok 4.316.94%
- Qwen3.8 27B18.09%
- MiniMax-M318.43%
- Quasar 438B21.44%
- K-EXAONE 2.0 080322.6%
- Grok 4.624%
- Solar Pro 424.4%
- MiMo-V2.5-Pro24.7%
- Solar Open2 250B25.38%
- Granite 4.2 30B25.58%
| Model and configuration | Score | Source |
|---|---|---|
| MiniCPM5-1B (Non-reasoning)OpenBMB | 0.9% | Original record |
| G9v3-3BAI9Stars | 11.66% | Original record |
| G9v3-39A5BAI9Stars | 13.04% | Original record |
| Command A+Cohere | 14.16% | Original record |
| LFM2.5-2.6BLiquid AI | 16% | Original record |
| Grok 4.3 (medium)SpaceXAI | 16.94% | Original record |
| Qwen3.8 27B (Non-reasoning)Alibaba | 18.09% | Original record |
| MiniMax-M3MiniMax | 18.43% | Original record |
| Quasar 438B (max, based on GLM-5.2)Multiverse Computing | 21.44% | Original record |
| K-EXAONE 2.0 0803 (K-EXAONE 2.0)LG AI Research | 22.6% | Original record |
| Grok 4.6 (medium)SpaceXAI | 24% | Original record |
| Solar Pro 4Upstage | 24.4% | Original record |
| MiMo-V2.5-ProXiaomi | 24.7% | Original record |
| Solar Open2 250BUpstage | 25.38% | Original record |
| Granite 4.2 30BIBM | 25.58% | Original record |
MathVision / Moonshot report5 results
Mathematics from visual problems.
- Gemini 3 Pro86.1
- Kimi K2.584.2
- GPT-5.283
- Claude Opus 4.577.1
- Qwen3-VL-235B-A22B74.6
| Model and configuration | Score | Source |
|---|---|---|
| Gemini 3 Pro (High Thinking Level; publisher rerun (*))Google | 86.1 | Original record |
| Kimi K2.5 (Thinking)Moonshot AI | 84.2 | Original record |
| GPT-5.2 (xhigh)OpenAI | 83 | Original record |
| Claude Opus 4.5 (Extended Thinking; publisher rerun (*))Anthropic | 77.1 | Original record |
| Qwen3-VL-235B-A22B (Thinking)Qwen | 74.6 | Original record |
OCRBench / Moonshot report5 results
Text recognition in images.
- Kimi K2.592.3
- Gemini 3 Pro90.3
- Qwen3-VL-235B-A22B87.5
- Claude Opus 4.586.5
- GPT-5.280.7
| Model and configuration | Score | Source |
|---|---|---|
| Kimi K2.5 (Thinking)Moonshot AI | 92.3 | Original record |
| Gemini 3 Pro (High Thinking Level; publisher rerun (*))Google | 90.3 | Original record |
| Qwen3-VL-235B-A22B (Thinking)Qwen | 87.5 | Original record |
| Claude Opus 4.5 (Extended Thinking; publisher rerun (*))Anthropic | 86.5 | Original record |
| GPT-5.2 (xhigh; publisher rerun (*))OpenAI | 80.7 | Original record |
OmniDocBench 1.5 / Moonshot report5 results
Document reading. The reported score is (1 − normalized edit distance) × 100.
- Kimi K2.588.8
- Gemini 3 Pro88.5
- Claude Opus 4.587.7
- GPT-5.285.7
- Qwen3-VL-235B-A22B82
| Model and configuration | Score | Source |
|---|---|---|
| Kimi K2.5 (Thinking)Moonshot AI | 88.8 | Original record |
| Gemini 3 Pro (High Thinking Level)Google | 88.5 | Original record |
| Claude Opus 4.5 (Extended Thinking; publisher rerun (*))Anthropic | 87.7 | Original record |
| GPT-5.2 (xhigh)OpenAI | 85.7 | Original record |
| Qwen3-VL-235B-A22B (Thinking; publisher rerun (*))Qwen | 82 | Original record |
VideoMMMU / Moonshot report5 results
Video understanding across subjects.
- Gemini 3 Pro87.6
- Kimi K2.586.6
- GPT-5.285.9
- Claude Opus 4.584.4
- Qwen3-VL-235B-A22B80
| Model and configuration | Score | Source |
|---|---|---|
| Gemini 3 Pro (High Thinking Level)Google | 87.6 | Original record |
| Kimi K2.5 (Thinking)Moonshot AI | 86.6 | Original record |
| GPT-5.2 (xhigh)OpenAI | 85.9 | Original record |
| Claude Opus 4.5 (Extended Thinking; publisher rerun (*))Anthropic | 84.4 | Original record |
| Qwen3-VL-235B-A22B (Thinking)Qwen | 80 | Original record |
MotionBench / Moonshot report4 results
Understanding motion in video.
- Kimi K2.570.4
- Gemini 3 Pro70.3
- GPT-5.264.8
- Claude Opus 4.560.3
| Model and configuration | Score | Source |
|---|---|---|
| Kimi K2.5 (Thinking)Moonshot AI | 70.4 | Original record |
| Gemini 3 Pro (High Thinking Level)Google | 70.3 | Original record |
| GPT-5.2 (xhigh)OpenAI | 64.8 | Original record |
| Claude Opus 4.5 (Extended Thinking)Anthropic | 60.3 | Original record |
IFBench / MiniMax report7 results
Following detailed instructions.
| Model and configuration | Score | Source |
|---|---|---|
| GPT-5.2 (Thinking; MiniMax internal evaluation)OpenAI | 75 | Original record |
| MiniMax-M2.5 (MiniMax internal evaluation)MiniMax | 70 | Original record |
| MiniMax-M2.1 (MiniMax internal evaluation)MiniMax | 70 | Original record |
| Gemini 3 Pro (MiniMax internal evaluation)Google | 70 | Original record |
| Claude Opus 4.5 (MiniMax internal evaluation)Anthropic | 58 | Original record |
| Claude Sonnet 4.5 (MiniMax internal evaluation)Anthropic | 57 | Original record |
| Claude Opus 4.6 (MiniMax internal evaluation)Anthropic | 53 | Original record |
MMMLU / DeepSeek Base report3 results
Multilingual knowledge, measured by exact match with five examples.
- DeepSeek-V4-Pro-Base90.3%
- DeepSeek-V4-Flash-Base88.8%
- DeepSeek-V3.2-Base87.9%
| Model and configuration | Score | Source |
|---|---|---|
| DeepSeek-V4-Pro-Base (Base; MMMLU EM; 5-shot; shared internal evaluation setup; sampling and tools not disclosed)DeepSeek | 90.3% | Original record |
| DeepSeek-V4-Flash-Base (Base; MMMLU EM; 5-shot; shared internal evaluation setup; sampling and tools not disclosed)DeepSeek | 88.8% | Original record |
| DeepSeek-V3.2-Base (Base; MMMLU EM; 5-shot; shared internal evaluation setup; sampling and tools not disclosed)DeepSeek | 87.9% | Original record |
OmniDocBench 1.5 / Qwen3.8-27B report5 results
Reading document images, using the publisher's reported score.
- Qwen3.7-Plus91.4
- Qwen3.8-27B91.1
- Qwen3.6-27B89.4
- Opus4.6 Max86.6
- Muse Glimmer-30B75.8
| Model and configuration | Score | Source |
|---|---|---|
| Qwen3.7-Plus (OmniDocBench 1.5; tools, reasoning effort and image settings not disclosed)Qwen | 91.4 | Original record |
| Qwen3.8-27B (OmniDocBench 1.5; tools, reasoning effort and image settings not disclosed)Qwen | 91.1 | Original record |
| Qwen3.6-27B (OmniDocBench 1.5; tools, reasoning effort and image settings not disclosed)Qwen | 89.4 | Original record |
| Opus4.6 Max (Max (table header); OmniDocBench 1.5 tools and image settings not disclosed)Anthropic | 86.6 | Original record |
| Muse Glimmer-30B (OmniDocBench 1.5; tools, reasoning effort and image settings not disclosed)Meta | 75.8 | Original record |
MMMU-Pro / Google G31 (2026-02-19)5 results
Multimodal understanding and reasoning without tools.
- Gemini 3 Pro81%
- Gemini 3.1 Pro80.5%
- GPT-5.279.5%
- Claude Sonnet 4.674.5%
- Claude Opus 4.673.9%
| Model and configuration | Score | Source |
|---|---|---|
| Gemini 3 Pro (Thinking (High); No tools; Standard (10 options) and Vision average)Google | 81% | Original record |
| Gemini 3.1 Pro (Thinking (High); No tools; Standard (10 options) and Vision average)Google | 80.5% | Original record |
| GPT-5.2 (Thinking (xhigh); No tools; Standard (10 options) and Vision average)OpenAI | 79.5% | Original record |
| Claude Sonnet 4.6 (Thinking (Max); No tools; Standard (10 options) and Vision average)Anthropic | 74.5% | Original record |
| Claude Opus 4.6 (Thinking (Max); No tools; Standard (10 options) and Vision average)Anthropic | 73.9% | Original record |
MRCR v2, 128k / Google G31 (2026-02-19)5 results
Retrieving eight target items from long context, averaged up to 128k tokens.
- Gemini 3.1 Pro84.9%
- Claude Sonnet 4.684.9%
- Claude Opus 4.684%
- GPT-5.283.8%
- Gemini 3 Pro77%
| Model and configuration | Score | Source |
|---|---|---|
| Gemini 3.1 Pro (Thinking (High); MRCR v2; 8 needles; 128k cumulative average)Google | 84.9% | Original record |
| Claude Sonnet 4.6 (Thinking (Max); MRCR v2; 8 needles; 128k cumulative average)Anthropic | 84.9% | Original record |
| Claude Opus 4.6 (Thinking (Max); MRCR v2; 8 needles; 128k cumulative average)Anthropic | 84% | Original record |
| GPT-5.2 (Thinking (xhigh); MRCR v2; 8 needles; 128k cumulative average)OpenAI | 83.8% | Original record |
| Gemini 3 Pro (Thinking (High); MRCR v2; 8 needles; 128k cumulative average)Google | 77% | Original record |
MRCR v2, 1M / Google G31 (2026-02-19)2 results
Retrieving eight target items at the 1M-token context point.
- Gemini 3.1 Pro26.3%
- Gemini 3 Pro26.3%
| Model and configuration | Score | Source |
|---|---|---|
| Gemini 3.1 Pro (Thinking (High); MRCR v2; 8 needles; 1M pointwise)Google | 26.3% | Original record |
| Gemini 3 Pro (Thinking (High); MRCR v2; 8 needles; 1M pointwise)Google | 26.3% | Original record |
CharXiv Reasoning / Google G38 (2026-09-02)6 results
Combining information from complex charts without tools.
- Gemini 3.8 Flash86.2%
- GPT-5.6 Terra85.9%
- GPT-5.6 Sol85.8%
- Gemini 3.7 Flash84.5%
- Claude Opus 583.7%
- Claude Sonnet 570.1%
| Model and configuration | Score | Source |
|---|---|---|
| Gemini 3.8 Flash (Default sampling; exact thinking level unspecified; No tools)Google | 86.2% | Original record |
| GPT-5.6 Terra (Maximum reasoning preferred; otherwise best available reported setting; No tools)OpenAI | 85.9% | Original record |
| GPT-5.6 Sol (Exact reasoning level unspecified; No tools)OpenAI | 85.8% | Original record |
| Gemini 3.7 Flash (Exact thinking level unspecified; No tools)Google | 84.5% | Original record |
| Claude Opus 5 (Exact thinking level unspecified; No tools)Anthropic | 83.7% | Original record |
| Claude Sonnet 5 (Maximum thinking preferred; otherwise best available reported setting; No tools)Anthropic | 70.1% | Original record |
Retrieval models
MTEB / OpenAI embeddings report3 results
Text embedding evaluation, separate from generative model reasoning.
| Model and configuration | Score | Source |
|---|---|---|
| text-embedding-3-large (Published MTEB result; evaluation dimensions unspecified)OpenAI | 64.6% | Original record |
| text-embedding-3-small (Published MTEB result; evaluation dimensions unspecified)OpenAI | 62.3% | Original record |
| text-embedding-ada-002 (Published MTEB result; evaluation dimensions unspecified)OpenAI | 61% | Original record |
Time and cost
Intelligence Index / Cost per task15 results
Weighted cost per evaluation task
- GLM 5.3 Flash0.18
- Muse Spark 1.20.55
- Gemini 3.8 Flash0.74
- GPT-5.6 Terra0.81
- Muse Spark 1.30.96
- Qwen3.8 2.4T A95B1.1
- Qwen3.8 Max1.19
- GPT-5.6 Sol1.25
- Grok 4.61.25
- GLM-5.31.26
- Kimi K31.58
- GPT-6 Astra2.57
- Claude Opus 54.21
- Claude Fable 55.62
- Claude Fable 5.16.12
| Model and configuration | Score | Source |
|---|---|---|
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 0.18 | Original record |
| Muse Spark 1.2 (xhigh)Meta | 0.55 | Original record |
| Gemini 3.8 Flash (high)Google | 0.74 | Original record |
| GPT-5.6 Terra (max)OpenAI | 0.81 | Original record |
| Muse Spark 1.3 (max)Meta | 0.96 | Original record |
| Qwen3.8 2.4T A95BAlibaba | 1.1 | Original record |
| Qwen3.8 MaxAlibaba | 1.19 | Original record |
| GPT-5.6 Sol (max)OpenAI | 1.25 | Original record |
| Grok 4.6 (high)SpaceXAI | 1.25 | Original record |
| GLM-5.3 (max)Z AI | 1.26 | Original record |
| Kimi K3 (max)Kimi | 1.58 | Original record |
| GPT-6 Astra (max)OpenAI | 2.57 | Original record |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 4.21 | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 5.62 | Original record |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 6.12 | Original record |
Output speed15 results
Output generation speed
- Gemini 3.8 Flash280.76
- Muse Spark 1.2269.24
- Muse Spark 1.3233.15
- GPT-5.6 Terra113.93
- GLM-5.383.31
- GPT-5.6 Sol75.78
- Claude Fable 5.168.22
- GPT-6 Astra64.26
- Claude Fable 562.97
- Grok 4.659.89
- Claude Opus 555.95
- GLM 5.3 Flash50.63
- Kimi K341.61
- Qwen3.8 2.4T A95B40.23
- Qwen3.8 Max40.15
| Model and configuration | Score | Source |
|---|---|---|
| Gemini 3.8 Flash (high)Google | 280.76 | Original record |
| Muse Spark 1.2 (xhigh)Meta | 269.24 | Original record |
| Muse Spark 1.3 (max)Meta | 233.15 | Original record |
| GPT-5.6 Terra (max)OpenAI | 113.93 | Original record |
| GLM-5.3 (max)Z AI | 83.31 | Original record |
| GPT-5.6 Sol (max)OpenAI | 75.78 | Original record |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 68.22 | Original record |
| GPT-6 Astra (max)OpenAI | 64.26 | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 62.97 | Original record |
| Grok 4.6 (high)SpaceXAI | 59.89 | Original record |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 55.95 | Original record |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 50.63 | Original record |
| Kimi K3 (max)Kimi | 41.61 | Original record |
| Qwen3.8 2.4T A95BAlibaba | 40.23 | Original record |
| Qwen3.8 MaxAlibaba | 40.15 | Original record |
API input price15 results
Price per million input tokens
| Model and configuration | Score | Source |
|---|---|---|
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 0.15 | Original record |
| Gemini 3.8 Flash (high)Google | 0.75 | Original record |
| Muse Spark 1.3 (max)Meta | 1.25 | Original record |
| Muse Spark 1.2 (xhigh)Meta | 1.25 | Original record |
| GLM-5.3 (max)Z AI | 1.4 | Original record |
| Grok 4.6 (high)SpaceXAI | 2 | Original record |
| Qwen3.8 MaxAlibaba | 2 | Original record |
| GPT-5.6 Terra (max)OpenAI | 2 | Original record |
| Qwen3.8 2.4T A95BAlibaba | 2 | Original record |
| Kimi K3 (max)Kimi | 3 | Original record |
| GPT-5.6 Sol (max)OpenAI | 4 | Original record |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 5 | Original record |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 10 | Original record |
| GPT-6 Astra (max)OpenAI | 10 | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 10 | Original record |
API output price15 results
Price per million output tokens
| Model and configuration | Score | Source |
|---|---|---|
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 0.5 | Original record |
| Gemini 3.8 Flash (high)Google | 3.75 | Original record |
| Muse Spark 1.3 (max)Meta | 4.25 | Original record |
| Muse Spark 1.2 (xhigh)Meta | 4.25 | Original record |
| GLM-5.3 (max)Z AI | 4.4 | Original record |
| Grok 4.6 (high)SpaceXAI | 6 | Original record |
| Qwen3.8 MaxAlibaba | 6 | Original record |
| Qwen3.8 2.4T A95BAlibaba | 6 | Original record |
| GPT-5.6 Terra (max)OpenAI | 12 | Original record |
| Kimi K3 (max)Kimi | 15 | Original record |
| GPT-5.6 Sol (max)OpenAI | 20 | Original record |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 25 | Original record |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 50 | Original record |
| GPT-6 Astra (max)OpenAI | 50 | Original record |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 50 | Original record |
Sources and further reading
- Anthropic. Demystifying evals for AI agents
- OpenAI. GDPval
- OpenAI. BrowseComp
- Parallel. Deep Research price-performance
- LangChain. Improving Deep Agents with harness engineering
- LangChain. Deep Agents source code
- DeepResearch Bench II. Evaluation code
- ResearchRubrics. Evaluation code
- Agents’ Last Exam. Tasks and evaluation