HDATF RESEARCH / BENCHMARK REPORT

What makes AI ready for real work?

Reading public evidence, testing the complete system, and defining what HDATF must prove next.

The finding

Public benchmarks help choose a model and design a test. Readiness for work must be established with the actual files, tools and completion criteria of the system being deployed.

This report interprets archived public results through three practical concerns: usable deliverables, traceable evidence and reliable execution. HDATF has not published its own measured scores for these evaluations. The final chapter therefore sets out an evaluation plan.

73 evaluations and metrics684 archived scores

01 / Reading the scores

Begin with the work you need done.

A benchmark is a repeatable test with a defined task and scoring rule. A reasoning test, a document comparison and a tool-use task each observe a different part of an AI system. Their scores answer different questions.

For a document workflow, success means the requested file can be opened, its evidence can be checked and its content meets the brief. For data analysis, the output must also be reproducible from the supplied data. A general model ranking does not resolve either decision on its own.

We use public results to narrow candidates and identify failure modes worth testing. To decide whether a method belongs in LabChin, we then need a matched task using our own sources, permissions, tools and output checks. This report follows that order.[1]

02 / Usable deliverables

Judge the deliverable against the actual brief.

GDPval makes professional deliverables the object of comparison. Its original Gold study used 220 tasks across 44 occupations, with experts comparing outputs without knowing who produced them. The chart reproduces three archived results from that study.

A win-or-tie rate describes those comparisons. It is not the proportion of jobs an organization can hand over to AI. The task set, reviewer judgment and model configurations define how far the result can be interpreted.[2]

Figure 01

GDPval Gold

Expert comparison: wins + ties (%)

%Higher is better
  1. Claude Opus 4.147.6%
  2. GPT-5 (high)38.8%
  3. o3 (high)34.1%
GDPval Gold / %
Model and configurationScoreSource
Claude Opus 4.1Anthropic47.6%Original record
GPT-5 (high)OpenAI38.8%Original record
o3 (high)OpenAI34.1%Original record

220 gold tasks across 44 occupations. Blind, pairwise expert grading in the original study. These are historical results, not current model rankings.

Source: OpenAI2025-09Original record

For HDATF, the practical question is how much work remains after the file is produced. A review should retain missing requirements, unsupported numbers and the revisions a person had to make. A polished layout is one part of quality; it cannot compensate for incorrect evidence or an unusable file.

03 / Evidence and research

Finding an answer and supporting a report are separate checks.

BrowseComp tests whether a system can locate difficult facts. Parallel's published comparison used a random sample of 100 questions from the 1,266-question set. It reported both accuracy and request cost. The results below therefore describe a sampled, provider-run experiment.[3][4]

Figure 02

BrowseComp / Parallel study

Correct answers (%)

%Higher is better
BrowseComp / Parallel study / %
Model and configurationScoreSource
Parallel Ultra8xParallel58%Original record
Parallel UltraParallel45%Original record
GPT-5 (high)OpenAI38%Original record

Random sample of 100 of 1,266 questions. Measured 11–29 August 2025 by Parallel. Ultra8x: $2.40/request; Ultra: $0.30; GPT-5: $0.488. Configurations and budgets differ.

Source: Parallel2025-09-09Original record

Ultra8x reported 58% accuracy at $2.40 per request; Ultra reported 45% at $0.30. Their budgets differ. These figures make the accuracy-cost tradeoff visible, but do not isolate the effect of the underlying model or prove an advantage at equal cost.

A research report needs additional checks. DeepResearch Bench II and ResearchRubrics examine report content against explicit criteria. For LabChin, we plan to retain the passages supporting each major claim, identify contradictory evidence and record which parts of the question remain unanswered.

04 / Execution and memory

The model works inside a system. Evaluate that system.

An agent harness is the software that supplies a model with tools, context and control over a task. LangChain held GPT-5.2-Codex fixed while changing this surrounding software. Its Terminal-Bench 2.0 result rose from 52.8% to 66.5% across 89 tasks.[5][6]

Figure 03

Terminal-Bench 2.0

Task success (%)

%Higher is better
Terminal-Bench 2.0 / %
Model and configurationScoreSource
Deep Agents / improvedLangChain66.5%Original record
Deep Agents / baselineLangChain52.8%Original record

89 tasks. GPT-5.2-Codex held fixed; LangChain changed prompts, tools and middleware. Harbor / Daytona execution. The post reports a 13.7 percentage-point improvement.

Source: LangChain2026-02-17Original record

The study changed instructions, tools and middleware together, including checks before completion and guidance about the environment. The 13.7-point difference belongs to that combined experiment. It does not establish the contribution of each individual change or predict HDATF's improvement.

This suggests a testable choice for our own work: hold the task and model fixed, then compare a workflow with and without output verification. Keep the produced file, verification result, retries and elapsed time. The test should explain both successful completion and the failures that required intervention.

Memory needs a separate test. Recalling an old fact is useful only if the system also handles corrections and keeps information within its permitted scope. The archived LoCoMo result covers single-hop recall; it does not verify these work-level requirements. We therefore keep it as supporting evidence in the appendix.

05 / HDATF evaluation plan

The next evidence must be our own work, measured.

The public studies identify useful questions; they do not supply a score for our product. Our next step is a recorded comparison on representative tasks. We plan to assess evidence retrieval, analysis and usable delivery separately, so a strong result in one area cannot hide a failure in another.

For research and data work, preserve the question, source versions and checks on the final output. A report should expose unsupported claims. An analysis should retain the input data, execution record and reproducible outputs. The following criteria define what we intend to inspect, not completed tests.[1][7][8][9]

Planned evaluation. No HDATF score published.

Find the evidence

BrowseComp tests finding hard-to-locate facts on the web. For LabChin, we also want to check whether each cited source supports the claim made from it.

Build a sound analysis

DeepResearch Bench II and ResearchRubrics provide criteria for research reports. We plan to check coverage, factual support and the reasoning behind the conclusion, not just fluent writing.

Deliver usable work

GDPval and Agents’ Last Exam examine professional tasks. We plan to check whether the requested work is complete, the files are usable, and a person still has to repair the result.

Evaluation scopeKeep as evidenceDecision it supports
TaskBrief, input files and acceptance criteriaDid the requested work get done?
ExecutionModel, tools, permissions and configuration versionCan another run use the same conditions?
OutcomeOutput files, source checks and human correctionsIs the output correct and usable?
EfficiencyElapsed time, tools, retries and total costIs the complete workflow affordable?
APPENDIX

Appendix. The complete evidence

Compare published scores by evaluation. Select a model name to open its source. Results reflect the recorded date; model-family comparisons show the best measured configuration for each family.

73 / 73 evaluations and metrics

Work and documents

AA-Briefcase15 results

Base model resultArtificial Analysis

Long-horizon knowledge work

EloHigher is better
  1. Claude Fable 5.11,661.91
  2. Claude Opus 51,647.02
  3. GPT-6 Astra1,561.95
  4. Muse Spark 1.31,558.85
  5. Grok 4.61,545.82
  6. Claude Fable 51,533.52
  7. GLM-5.31,515.45
  8. Kimi K31,496.83
  9. GPT-5.6 Sol1,474.49
  10. GLM 5.3 Flash1,459.13
  11. Qwen3.8 2.4T A95B1,442.81
  12. DeepSeek V4 Flash 07311,433.23
  13. Qwen3.8 27B1,401.81
  14. Qwen3.8 Max1,392.33
  15. Claude Sonnet 51,358.11
AA-Briefcase / Elo
Model and configurationScoreSource
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic1,661.91Original record
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic1,647.02Original record
GPT-6 Astra (max)OpenAI1,561.95Original record
Muse Spark 1.3 (max)Meta1,558.85Original record
Grok 4.6 (xhigh)SpaceXAI1,545.82Original record
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic1,533.52Original record
GLM-5.3 (max)Z AI1,515.45Original record
Kimi K3 (max)Kimi1,496.83Original record
GPT-5.6 Sol (max)OpenAI1,474.49Original record
GLM 5.3 Flash (GLM-5.3-Flash)Z AI1,459.13Original record
Qwen3.8 2.4T A95BAlibaba1,442.81Original record
DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek1,433.23Original record
Qwen3.8 27B (xhigh)Alibaba1,401.81Original record
Qwen3.8 MaxAlibaba1,392.33Original record
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic1,358.11Original record
AA-Briefcase / Rubric15 results

Base model resultArtificial Analysis

Required checks passed

%Higher is better
AA-Briefcase / Rubric / %
Model and configurationScoreSource
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic61.52%Original record
Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic57.98%Original record
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic55.96%Original record
Muse Spark 1.3 (max)Meta54.87%Original record
Grok 4.6 (xhigh)SpaceXAI53.84%Original record
GPT-6 Astra (xhigh)OpenAI52.32%Original record
GLM-5.3 (max)Z AI51.35%Original record
Kimi K3 (max)Kimi50.97%Original record
Qwen3.8 2.4T A95BAlibaba50%Original record
Qwen3.8 MaxAlibaba49.6%Original record
Qwen3.8 27B (xhigh)Alibaba47.8%Original record
GLM 5.3 Flash (GLM-5.3-Flash)Z AI46.36%Original record
DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek46.15%Original record
Muse Spark 1.2 (xhigh)Meta45.15%Original record
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek43.52%Original record
AA-Briefcase / Analytical quality15 results

Base model resultArtificial Analysis

Quality of analysis

EloHigher is better
  1. Claude Fable 5.11,959.49
  2. Claude Opus 51,909.74
  3. GLM-5.31,788.62
  4. GPT-6 Astra1,753.64
  5. Muse Spark 1.31,711.52
  6. Grok 4.61,682.58
  7. Claude Fable 51,676.55
  8. Kimi K31,668.89
  9. GLM 5.3 Flash1,650.95
  10. Qwen3.8 2.4T A95B1,617.45
  11. DeepSeek V4 Flash 07311,617.37
  12. Qwen3.8 27B1,590.24
  13. GPT-5.6 Sol1,537.92
  14. Qwen3.8 Max1,533.14
  15. Claude Sonnet 51,418.22
AA-Briefcase / Analytical quality / Elo
Model and configurationScoreSource
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic1,959.49Original record
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic1,909.74Original record
GLM-5.3 (max)Z AI1,788.62Original record
GPT-6 Astra (max)OpenAI1,753.64Original record
Muse Spark 1.3 (max)Meta1,711.52Original record
Grok 4.6 (xhigh)SpaceXAI1,682.58Original record
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic1,676.55Original record
Kimi K3 (max)Kimi1,668.89Original record
GLM 5.3 Flash (GLM-5.3-Flash)Z AI1,650.95Original record
Qwen3.8 2.4T A95BAlibaba1,617.45Original record
DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek1,617.37Original record
Qwen3.8 27B (xhigh)Alibaba1,590.24Original record
GPT-5.6 Sol (max)OpenAI1,537.92Original record
Qwen3.8 MaxAlibaba1,533.14Original record
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic1,418.22Original record
AA-Briefcase / Presentation15 results

Base model resultArtificial Analysis

Deliverable presentation

EloHigher is better
  1. GPT-5.6 Sol1,633.93
  2. Claude Opus 51,544.01
  3. GPT-6 Astra1,535.29
  4. GPT-5.6 Terra1,519.13
  5. Grok 4.61,514.68
  6. Muse Spark 1.31,506.83
  7. Claude Fable 5.11,472.7
  8. GPT-5.6 Luna1,471.03
  9. Claude Fable 51,456.83
  10. Kimi K31,435.29
  11. Claude Sonnet 51,409.5
  12. GLM 5.3 Flash1,409.12
  13. DeepSeek V4 Flash 07311,355.99
  14. GLM-5.31,354.5
  15. Muse Spark 1.21,334.35
AA-Briefcase / Presentation / Elo
Model and configurationScoreSource
GPT-5.6 Sol (max)OpenAI1,633.93Original record
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic1,544.01Original record
GPT-6 Astra (max)OpenAI1,535.29Original record
GPT-5.6 Terra (max)OpenAI1,519.13Original record
Grok 4.6 (xhigh)SpaceXAI1,514.68Original record
Muse Spark 1.3 (max)Meta1,506.83Original record
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic1,472.7Original record
GPT-5.6 Luna (max)OpenAI1,471.03Original record
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic1,456.83Original record
Kimi K3 (max)Kimi1,435.29Original record
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic1,409.5Original record
GLM 5.3 Flash (GLM-5.3-Flash)Z AI1,409.12Original record
DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek1,355.99Original record
GLM-5.3 (max)Z AI1,354.5Original record
Muse Spark 1.2 (xhigh)Meta1,334.35Original record
GDPval-AA v215 results

Base model resultArtificial Analysis

Real-world professional work

EloHigher is better
GDPval-AA v2 / Elo
Model and configurationScoreSource
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic1,765.9Original record
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic1,738.08Original record
Muse Spark 1.3 (max)Meta1,719.65Original record
GLM-5.3 (max)Z AI1,678.47Original record
GLM 5.3 Flash (GLM-5.3-Flash)Z AI1,672.94Original record
Grok 4.6 (xhigh)SpaceXAI1,664.82Original record
Qwen3.8-Flash-NextAlibaba1,649.93Original record
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic1,635.39Original record
Qwen3.8 MaxAlibaba1,633.53Original record
Qwen3.8 2.4T A95BAlibaba1,630.39Original record
GPT-5.6 Sol (max)OpenAI1,625.68Original record
Kimi K3 (max)Kimi1,585.72Original record
GPT-6 Astra (max)OpenAI1,582.24Original record
DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek1,579.3Original record
Muse Spark 1.2 (xhigh)Meta1,525.03Original record
AA-AnalystAgent / pass^515 results

Base model resultArtificial Analysis

Reliable spreadsheet and document analysis

%Higher is better
AA-AnalystAgent / pass^5 / %
Model and configurationScoreSource
Gemini 3.7 Flash (high)Google60%Original record
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic57.5%Original record
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic53.75%Original record
GPT-6 Astra (max)OpenAI51.25%Original record
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic48.75%Original record
GPT-5.6 Sol (max)OpenAI47.5%Original record
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic46.25%Original record
Gemini 3.1 Pro PreviewGoogle41.25%Original record
Grok 4.6 (high)SpaceXAI41.25%Original record
Kimi K3 (max)Kimi38.75%Original record
Grok 4.5 (high)SpaceXAI35%Original record
Inkling SmallThinking Machines27.5%Original record
Inkling (xhigh)Thinking Machines23.75%Original record
MiMo-V2.5-ProXiaomi20%Original record
DeepSeek V4 Pro 0424 (DeepSeek V4 Pro (Reasoning, Max Effort))DeepSeek18.75%Original record
GDP.pdf / All-pass15 results

Base model resultArtificial Analysis

Professional document reasoning

%Higher is better
GDP.pdf / All-pass / %
Model and configurationScoreSource
GPT-6 Astra (max)OpenAI33.2%Original record
GPT-5.6 Sol (max)OpenAI28.2%Original record
Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)Anthropic28%Original record
Muse Spark 1.3 (max)Meta25.6%Original record
GPT-5.6 Terra (max)OpenAI25.6%Original record
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic24%Original record
GPT-5.6 Luna (xhigh)OpenAI23.8%Original record
Gemini 3.7 Flash (high)Google23.6%Original record
Gemini 3.8 Flash (medium)Google22.8%Original record
Qwen3.8 MaxAlibaba21.8%Original record
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic21.6%Original record
GPT-5.5 Instant (June 2026)OpenAI20.2%Original record
Kimi K3 (max)Kimi19.6%Original record
Grok 4.5 (high)SpaceXAI18.8%Original record
Grok 4.6 (high)SpaceXAI18.8%Original record
AutomationBench-AA15 results

Base model resultArtificial Analysis

Objectives completed in SaaS workflows

%Higher is better
AutomationBench-AA / %
Model and configurationScoreSource
Gemini 3.7 Flash (high)Google62.75%Original record
Kimi K3 (max)Kimi52.71%Original record
Grok 4.5 (high)SpaceXAI51.44%Original record
GPT-5.6 Sol (max)OpenAI51.19%Original record
Gemini 3.6 Flash (high)Google51.08%Original record
Gemini 3.8 Flash (high)Google50.72%Original record
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic48.58%Original record
GPT-5.6 Terra (max)OpenAI45.61%Original record
GPT-5.6 Luna (max)OpenAI42.24%Original record
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic39.19%Original record
Gemini 3.1 Pro PreviewGoogle37.54%Original record
Gemini 3.5 Flash-LiteGoogle32.66%Original record
GLM-5.2 (max)Z AI27.84%Original record
Kimi K2.7 CodeKimi22.53%Original record
Qwen3.7 PlusAlibaba20.43%Original record
EnterpriseOps-Gym-AA15 results

Base model resultArtificial Analysis

Enterprise operations

%Higher is better
EnterpriseOps-Gym-AA / %
Model and configurationScoreSource
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic51.12%Original record
Gemini 3.7 Flash (medium)Google50.4%Original record
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek49.6%Original record
Grok 4.6 (high)SpaceXAI48.34%Original record
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic47.48%Original record
Qwen3.8 2.4T A95BAlibaba47.36%Original record
Muse Spark 1.2 (xhigh)Meta47.27%Original record
DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek47.09%Original record
Kimi K3 (max)Kimi45.33%Original record
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic44.67%Original record
Qwen3.8 27B (xhigh)Alibaba44.23%Original record
GPT-5.6 Sol (max)OpenAI42.91%Original record
GLM-5.2 (max)Z AI42.73%Original record
Inkling SmallThinking Machines42.7%Original record
Gemini 3.5 Flash-LiteGoogle42.35%Original record
APEX-Agents-AA14 results

Base model resultArtificial Analysis

Long-horizon professional tasks

%Higher is better
APEX-Agents-AA / %
Model and configurationScoreSource
Kimi K3 (max)Kimi41.3%Original record
GPT-5.6 Terra (max)OpenAI38.94%Original record
GPT-5.6 Luna (max)OpenAI35.84%Original record
GLM-5.2 (max)Z AI33.7%Original record
Gemini 3.1 Pro PreviewGoogle32.01%Original record
Apodex 1.1Apodex31.19%Original record
DeepSeek V4 Pro 0424 (DeepSeek V4 Pro (Reasoning, Max Effort))DeepSeek24.26%Original record
Qwen3.7 PlusAlibaba22.42%Original record
Qwen3.5 397B A17B (Reasoning)Alibaba15.34%Original record
Step 3.7 FlashStepFun14.82%Original record
gpt-oss-120b (high)OpenAI3.1%Original record
MiMo-V2.5-ProXiaomi2.43%Original record
Nemotron 3 Super 120B A12B (Reasoning)NVIDIA1.84%Original record
gpt-oss-20b (high)OpenAI0.74%Original record

System studies

GDPval Gold3 results

Expert-comparison studyOpenAI

Can an AI deliver work that a professional would accept? Expert comparison: wins + ties (%)

%Higher is better
  1. Claude Opus 4.147.6%
  2. GPT-5 (high)38.8%
  3. o3 (high)34.1%
GDPval Gold / %
Model and configurationScoreSource
Claude Opus 4.1Anthropic47.6%Original record
GPT-5 (high)OpenAI38.8%Original record
o3 (high)OpenAI34.1%Original record
BrowseComp / Parallel study3 results

Research-agent studyParallel

Can an agent find and connect hard-to-locate evidence? Correct answers (%)

%Higher is better
BrowseComp / Parallel study / %
Model and configurationScoreSource
Parallel Ultra8xParallel58%Original record
Parallel UltraParallel45%Original record
GPT-5 (high)OpenAI38%Original record
Terminal-Bench 2.02 results

Execution-system studyLangChain

How much can the execution system change the outcome? Task success (%)

%Higher is better
Terminal-Bench 2.0 / %
Model and configurationScoreSource
Deep Agents / improvedLangChain66.5%Original record
Deep Agents / baselineLangChain52.8%Original record
LoCoMo / single-hop3 results

Memory-system studyMem0 research team

Does useful information survive across conversations? LLM-as-a-Judge score, single-hop (0–100)

scoreHigher is better
  1. Mem067.13
  2. LangMem62.23
  3. Zep61.7
LoCoMo / single-hop / score
Model and configurationScoreSource
Mem0Mem067.13Original record
LangMemLangChain62.23Original record
ZepZep61.7Original record

Agents and tools

τ³-Banking15 results

Base model resultArtificial Analysis

Banking policies and tool execution

%Higher is better
τ³-Banking / %
Model and configurationScoreSource
Muse Spark 1.3 (max)Meta52.37%Original record
Qwen3.8 MaxAlibaba51.34%Original record
Grok 4.6 (high)SpaceXAI50.72%Original record
GLM-5.3 (max)Z AI50.31%Original record
Qwen3.8 2.4T A95BAlibaba49.07%Original record
Qwen3.8 27B (xhigh)Alibaba48.04%Original record
GLM 5.3 Flash (GLM-5.3-Flash)Z AI47.22%Original record
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic47.22%Original record
Kimi K3 (max)Kimi45.98%Original record
Gemini 3.8 Flash (medium)Google45.77%Original record
Qwen3.8-Flash-NextAlibaba45.36%Original record
Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic44.74%Original record
GPT-5.6 Sol (max)OpenAI44.33%Original record
GPT-6 Astra (xhigh)OpenAI43.09%Original record
Grok 4.5 (high)SpaceXAI42.06%Original record
τ²-Bench15 results

Base model resultArtificial Analysis

Conversational tool use

%Higher is better
τ²-Bench / %
Model and configurationScoreSource
JT-35B-FlashChina Mobile99.12%Original record
GLM-5.2 (max)Z AI99.12%Original record
Step 3.7 FlashStepFun98.54%Original record
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic98.54%Original record
DeepSeek V4 Pro 0424 (DeepSeek V4 Pro (Reasoning, Max Effort))DeepSeek96.2%Original record
Qwen3.5 397B A17B (Reasoning)Alibaba95.61%Original record
Gemini 3.5 Flash (medium)Google95.61%Original record
Gemini 3.1 Pro PreviewGoogle95.61%Original record
Qwen3.6 35B A3B (Reasoning)Alibaba95.32%Original record
DeepSeek V4 Flash 0420 (DeepSeek V4 Flash (Non-reasoning))DeepSeek94.44%Original record
MiMo-V2.5-ProXiaomi94.15%Original record
Qwen3.6 27B (Reasoning)Alibaba94.15%Original record
Mistral Medium 3.5Mistral94.15%Original record
Qwen3.5 122B A10B (Reasoning)Alibaba93.57%Original record
MiMo-V2-Flash (Feb 2026)Xiaomi93.27%Original record
ITBench-AA15 results

Base model resultArtificial Analysis

Incident root-cause analysis

%Higher is better
ITBench-AA / %
Model and configurationScoreSource
GPT-5.6 Sol (max)OpenAI56.21%Original record
GPT-5.6 Terra (max)OpenAI51.04%Original record
Kimi K3 (max)Kimi47.69%Original record
GLM-5.2 (max)Z AI42.66%Original record
GPT-5.6 Luna (max)OpenAI40.32%Original record
DeepSeek V4 Pro 0424 (DeepSeek V4 Pro (Reasoning, Max Effort))DeepSeek38.32%Original record
MiMo-V2.5-ProXiaomi38.23%Original record
Gemma 4 31B (Reasoning)Google37.29%Original record
Qwen3.5 397B A17B (Reasoning)Alibaba34.09%Original record
Gemini 3.1 Pro PreviewGoogle30.33%Original record
Step 3.7 FlashStepFun30.27%Original record
Claude 4.5 Haiku (Reasoning)Anthropic27.31%Original record
Gemma 4 26B A4B (Reasoning)Google23.63%Original record
gpt-oss-120b (high)OpenAI5.65%Original record
Nemotron 3 Super 120B A12B (Reasoning)NVIDIA1.13%Original record
MCP-Atlas public set / Z.ai report7 results

Vendor-reported model resultZ.ai (model-card report)

Completing tasks with connected tools.

%Higher is better
MCP-Atlas public set / Z.ai report / %
Model and configurationScoreSource
GPT-5.2 (xhigh)OpenAI68%Original record
GLM-5 release reportZ.ai67.8%Original record
Gemini 3 Pro (GLM-5 release comparison)Google66.6%Original record
Claude Opus 4.5 (GLM-5 release comparison)Anthropic65.2%Original record
Kimi K2.5 (GLM-5 release comparison)Moonshot AI63.8%Original record
DeepSeek V3.2 (GLM-5 release comparison)DeepSeek62.2%Original record
GLM-4.7 (GLM-5 release comparison)Z.ai52%Original record

Code and execution

Terminal-Bench v2.115 results

Base model resultArtificial Analysis

Terminal task completion

%Higher is better
Terminal-Bench v2.1 / %
Model and configurationScoreSource
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic91.39%Original record
GPT-6 Astra (high)OpenAI89.89%Original record
GPT-5.6 Sol (xhigh)OpenAI89.51%Original record
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic89.14%Original record
Grok 4.6 (high)SpaceXAI88.39%Original record
GPT-5.6 Terra (max)OpenAI88.01%Original record
Gemini 3.8 Flash (high)Google87.64%Original record
Qwen3.8-Flash-NextAlibaba86.14%Original record
Muse Spark 1.3 (max)Meta85.77%Original record
Gemini 3.7 Flash (high)Google85.77%Original record
Kimi K3 (max)Kimi85.02%Original record
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic84.64%Original record
GLM 5.3 Flash (GLM-5.3-Flash)Z AI84.27%Original record
GLM-5.3 (max)Z AI83.9%Original record
Qwen3.8 2.4T A95BAlibaba82.02%Original record
SciCode15 results

Base model resultArtificial Analysis

Scientific programming

%Higher is better
SciCode / %
Model and configurationScoreSource
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic63.08%Original record
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic61%Original record
Gemini 3.7 Flash (medium)Google59.84%Original record
Muse Spark 1.3 (xhigh)Meta59.72%Original record
Kimi K3 (max)Kimi59.49%Original record
GLM-5.3 (max)Z AI59.03%Original record
Gemini 3.1 Pro PreviewGoogle58.68%Original record
GPT-5.6 Sol (high)OpenAI57.75%Original record
Muse Spark 1.2 (xhigh)Meta57.41%Original record
Gemini 3.8 Flash (high)Google56.6%Original record
GPT-6 Astra (max)OpenAI56.48%Original record
Grok 4.6 (high)SpaceXAI56.48%Original record
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic56.37%Original record
Grok 4.5 (high)SpaceXAI54.98%Original record
GPT-5.6 Terra (max)OpenAI54.98%Original record
LiveCodeBench15 results

Base model resultArtificial Analysis

Competitive programming

%Higher is better
LiveCodeBench / %
Model and configurationScoreSource
gpt-oss-120b (high)OpenAI87.83%Original record
ERNIE 5.0 Thinking PreviewBaidu81.16%Original record
o3OpenAI80.85%Original record
Apriel-v1.6-15B-ThinkerServiceNow80.74%Original record
Qwen3 Next 80B A3B (Reasoning)Alibaba78.41%Original record
INTELLECT-3Prime Intellect77.67%Original record
gpt-oss-20b (high)OpenAI77.67%Original record
K-EXAONE (Reasoning)LG AI Research76.83%Original record
Doubao Seed CodeByteDance Seed76.61%Original record
Magistral Medium 1.2Mistral75.03%Original record
EXAONE 4.0 32B (Reasoning)LG AI Research74.71%Original record
NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)NVIDIA74.07%Original record
Llama Nemotron Super 49B v1.5 (Reasoning)NVIDIA73.65%Original record
Nova 2.0 Pro Preview (medium)Amazon73.02%Original record
Falcon-H1R-7BTII UAE72.38%Original record
SciCode / MiniMax report7 results

Vendor-reported model resultMiniMax (internal evaluation)

Scientific programming tasks.

scoreHigher is better
SciCode / MiniMax report / score
Model and configurationScoreSource
Gemini 3 Pro (MiniMax internal evaluation)Google56Original record
Claude Opus 4.6 (MiniMax internal evaluation)Anthropic52Original record
GPT-5.2 (Thinking; MiniMax internal evaluation)OpenAI52Original record
Claude Opus 4.5 (MiniMax internal evaluation)Anthropic50Original record
Claude Sonnet 4.5 (MiniMax internal evaluation)Anthropic45Original record
MiniMax-M2.5 (MiniMax internal evaluation)MiniMax44.4Original record
MiniMax-M2.1 (MiniMax internal evaluation)MiniMax41Original record
Terminal Bench 2.1 / DeepSeek GA report8 results

Vendor-reported model resultDeepSeek (GA model-card report)

Coding and tool use in terminal tasks.

scoreHigher is better
Terminal Bench 2.1 / DeepSeek GA report / score
Model and configurationScoreSource
Kimi K3 (Code-agent evaluation; harness and reasoning effort not disclosed for this model)Moonshot AI88.3Original record
Fable-5 (w/ fallback) (Code-agent evaluation; harness and reasoning effort not disclosed for this model; with fallback, details unspecified)Anthropic88Original record
DeepSeek-V4-Pro-0813 (DeepSeek Harness minimal; max reasoning effort; temperature=1.0; top_p=0.95)DeepSeek87.9Original record
Opus-4.8 (Code-agent evaluation; harness and reasoning effort not disclosed for this model)Anthropic85Original record
DeepSeek-V4-Flash-0731 (Code-agent evaluation; harness and reasoning effort not disclosed for this model)DeepSeek82.7Original record
GLM-5.2 (Code-agent evaluation; harness and reasoning effort not disclosed for this model)Z.ai81Original record
DeepSeek-V4-Pro (Preview) (Code-agent evaluation; harness and reasoning effort not disclosed for this model)DeepSeek72.1Original record
DeepSeek-V4-Flash (Preview) (Code-agent evaluation; harness and reasoning effort not disclosed for this model)DeepSeek61.8Original record
SWE-bench Pro refined set / Qwen3.8-Max report5 results

Vendor-reported model resultQwen (model-card report)

Code fixes on Qwen's corrected SWE-bench Pro evaluation set.

scoreHigher is better
SWE-bench Pro refined set / Qwen3.8-Max report / score
Model and configurationScoreSource
Fable 5 (Qwen-refined set; Claude Code; temperature=1.0; top_p=0.95; 256K context; may involve fallback; reasoning effort not disclosed)Anthropic80Original record
Opus 4.8 (Qwen-refined set; Claude Code; temperature=1.0; top_p=0.95; 256K context; reasoning effort not disclosed)Anthropic69.2Original record
Qwen3.8-Max service model; Qwen-refined set; Claude Code; temperature=1.0; top_p=0.95; 256K context; reasoning effort not disclosedQwen67.7Original record
GPT 5.6 Sol (max) (Qwen-refined set; Claude Code; max (table header); temperature=1.0; top_p=0.95; 256K context)OpenAI64.6Original record
Qwen3.7-Max (Qwen-refined set; Claude Code; temperature=1.0; top_p=0.95; 256K context; reasoning effort not disclosed)Qwen60.6Original record
SWE-bench Verified / Google G31 (2026-02-19)5 results

Vendor-reported model resultGoogle DeepMind (Gemini 3.1 Pro release comparison)

Repository issue resolution by a model and its coding-agent environment.

%Higher is better
SWE-bench Verified / Google G31 (2026-02-19) / %
Model and configurationScoreSource
Claude Opus 4.6 (Thinking (Max); Single attempt; provider-specific scaffolding)Anthropic80.8%Original record
Gemini 3.1 Pro (Thinking (High); Single attempt; provider-specific scaffolding)Google80.6%Original record
GPT-5.2 (Thinking (xhigh); Single attempt; provider-specific scaffolding)OpenAI80%Original record
Claude Sonnet 4.6 (Thinking (Max); Single attempt; provider-specific scaffolding)Anthropic79.6%Original record
Gemini 3 Pro (Thinking (High); Single attempt; provider-specific scaffolding)Google76.2%Original record
SWE-bench Pro (Public) / Google G31 (2026-02-19)4 results

Vendor-reported model resultGoogle DeepMind (Gemini 3.1 Pro release comparison)

Public SWE-bench Pro software-engineering tasks.

%Higher is better
SWE-bench Pro (Public) / Google G31 (2026-02-19) / %
Model and configurationScoreSource
GPT-5.3-Codex (Thinking (xhigh); Public split; single attempt; provider-specific scaffolding)OpenAI56.8%Original record
GPT-5.2 (Thinking (xhigh); Public split; single attempt; provider-specific scaffolding)OpenAI55.6%Original record
Gemini 3.1 Pro (Thinking (High); Public split; single attempt; provider-specific scaffolding)Google54.2%Original record
Gemini 3 Pro (Thinking (High); Public split; single attempt; provider-specific scaffolding)Google43.3%Original record

Model reasoning

Intelligence Index v4.215 results

Base model resultArtificial Analysis

Ten-evaluation composite

scoreHigher is better
Intelligence Index v4.2 / score
Model and configurationScoreSource
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic56.76Original record
GPT-6 Astra (max)OpenAI54.66Original record
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic54.05Original record
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic53.19Original record
Muse Spark 1.3 (max)Meta52.95Original record
GPT-5.6 Sol (max)OpenAI51.26Original record
Grok 4.6 (high)SpaceXAI50.58Original record
Kimi K3 (max)Kimi50.23Original record
GLM-5.3 (max)Z AI48.58Original record
Gemini 3.8 Flash (high)Google47.07Original record
Qwen3.8 MaxAlibaba46.91Original record
Muse Spark 1.2 (xhigh)Meta46.84Original record
GPT-5.6 Terra (max)OpenAI46.77Original record
Qwen3.8 2.4T A95BAlibaba46.74Original record
GLM 5.3 Flash (GLM-5.3-Flash)Z AI46.22Original record
Humanity's Last Exam15 results

Base model resultArtificial Analysis

Expert-level reasoning and knowledge

%Higher is better
Humanity's Last Exam / %
Model and configurationScoreSource
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic59.13%Original record
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic55.47%Original record
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic54.87%Original record
GPT-6 Astra (max)OpenAI54.68%Original record
GPT-5.6 Sol (max)OpenAI49.49%Original record
Muse Spark 1.3 (max)Meta49.07%Original record
Gemini 3.7 Flash (high)Google47.87%Original record
Gemini 3.8 Flash (high)Google47.82%Original record
Gemini 3.1 Pro PreviewGoogle47.03%Original record
Kimi K3 (max)Kimi46.9%Original record
Muse Spark 1.2 (xhigh)Meta45.46%Original record
Grok 4.6 (xhigh)SpaceXAI44.07%Original record
Qwen3.8 MaxAlibaba43.05%Original record
GPT-5.6 Terra (max)OpenAI42.91%Original record
Grok 4.5 (high)SpaceXAI42.68%Original record
GPQA Diamond15 results

Base model resultArtificial Analysis

Graduate-level science

%Higher is better
GPQA Diamond / %
Model and configurationScoreSource
GPT-6 Astra (xhigh)OpenAI96.26%Original record
Gemini 3.8 Flash (high)Google95.25%Original record
Grok 4.6 (high)SpaceXAI94.95%Original record
Gemini 3.7 Flash (high)Google94.55%Original record
Gemini 3.1 Pro PreviewGoogle94.14%Original record
Muse Spark 1.3 (xhigh)Meta94.14%Original record
GPT-5.6 Sol (max)OpenAI94.14%Original record
Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic93.74%Original record
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic93.74%Original record
Qwen3.8 2.4T A95BAlibaba93.54%Original record
Kimi K3 (max)Kimi93.54%Original record
Grok 4.5 (high)SpaceXAI93.13%Original record
MiniMax-M3MiniMax92.93%Original record
Gemini 3.6 Flash (high)Google92.83%Original record
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek92.83%Original record
CritPt15 results

Base model resultArtificial Analysis

Research-level physics

%Higher is better
CritPt / %
Model and configurationScoreSource
GPT-5.6 Sol (max)OpenAI32.29%Original record
GPT-6 Astra (max)OpenAI31.71%Original record
Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropic31.14%Original record
GPT-5.5 Pro (xhigh)OpenAI30.57%Original record
GPT-5.6 Terra (max)OpenAI30%Original record
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic29.14%Original record
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic28.57%Original record
Muse Spark 1.3 (xhigh)Meta26%Original record
Gemini 3 Deep ThinkGoogle25.71%Original record
Kimi K3 (max)Kimi23.43%Original record
GLM-5.2 (max)Z AI20.86%Original record
GPT-5.6 Luna (max)OpenAI20.57%Original record
Qwen3.8 MaxAlibaba20%Original record
Qwen3.8 2.4T A95BAlibaba20%Original record
Grok 4.6 (xhigh)SpaceXAI19.71%Original record
AIME 202515 results

Base model resultArtificial Analysis

Competition mathematics

%Higher is better
AIME 2025 / %
Model and configurationScoreSource
Nova 2.0 Lite (high)Amazon94.33%Original record
gpt-oss-120b (high)OpenAI93.44%Original record
NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)NVIDIA91%Original record
K-EXAONE (Reasoning)LG AI Research90.33%Original record
Nova 2.0 Omni (medium)Amazon89.67%Original record
gpt-oss-20b (high)OpenAI89.33%Original record
Nova 2.0 Pro Preview (medium)Amazon89%Original record
o3OpenAI88.33%Original record
INTELLECT-3Prime Intellect88%Original record
Apriel-v1.6-15B-ThinkerServiceNow88%Original record
ERNIE 5.0 Thinking PreviewBaidu85%Original record
Qwen3 Next 80B A3B (Reasoning)Alibaba84.33%Original record
Ring-flash-2.0InclusionAI83.67%Original record
Claude 4.5 Haiku (Reasoning)Anthropic83.67%Original record
Magistral Medium 1.2Mistral82%Original record
IFBench15 results

Base model resultArtificial Analysis

Instruction following

%Higher is better
IFBench / %
Model and configurationScoreSource
Grok 4.3 (medium)SpaceXAI83.33%Original record
MiniMax-M3MiniMax82.86%Original record
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA81.36%Original record
Nemotron Cascade 2 30B A3BNVIDIA80.41%Original record
MiMo-V2.5-ProXiaomi79.86%Original record
Nova 2.0 Pro Preview (low)Amazon79.59%Original record
Qwen3.5 397B A17B (Reasoning)Alibaba78.78%Original record
Qwen3.7 PlusAlibaba77.96%Original record
Gemini 3.1 Pro PreviewGoogle77.14%Original record
DeepSeek V4 Pro 0424 (DeepSeek V4 Pro (Reasoning, Max Effort))DeepSeek76.46%Original record
Qwen3.5 122B A10B (Reasoning)Alibaba75.71%Original record
Gemma 4 31B (Reasoning)Google75.58%Original record
GPT-5.3 Codex (xhigh)OpenAI75.37%Original record
Gemini 3.5 Flash (medium)Google74.56%Original record
Command A+Cohere73.95%Original record
LongBench v2 / Moonshot report5 results

Vendor-reported model resultMoonshot AI (model-card report)

Reading and reasoning over long inputs.

scoreHigher is better
LongBench v2 / Moonshot report / score
Model and configurationScoreSource
Gemini 3 Pro (High Thinking Level; publisher rerun (*))Google68.2Original record
Claude Opus 4.5 (Extended Thinking; publisher rerun (*))Anthropic64.4Original record
Kimi K2.5 (Thinking)Moonshot AI61Original record
DeepSeek V3.2 (Thinking; publisher rerun (*))DeepSeek59.8Original record
GPT-5.2 (xhigh; publisher rerun (*))OpenAI54.5Original record
AIME 2026 I / Z.ai report6 results

Vendor-reported model resultZ.ai (model-card report)

The first 2026 AIME exam, not the combined 2026 set.

scoreHigher is better
AIME 2026 I / Z.ai report / score
Model and configurationScoreSource
Claude Opus 4.5 (GLM-5 release comparison)Anthropic93.3Original record
GLM-4.7 (GLM-5 release comparison)Z.ai92.9Original record
GLM-5 release reportZ.ai92.7Original record
DeepSeek V3.2 (GLM-5 release comparison)DeepSeek92.7Original record
Kimi K2.5 (GLM-5 release comparison)Moonshot AI92.5Original record
Gemini 3 Pro (GLM-5 release comparison)Google90.6Original record
HMMT November 2025 / Z.ai report7 results

Vendor-reported model resultZ.ai (model-card report)

The November 2025 mathematics competition.

scoreHigher is better
HMMT November 2025 / Z.ai report / score
Model and configurationScoreSource
GPT-5.2 (xhigh)OpenAI97.1Original record
GLM-5 release reportZ.ai96.9Original record
GLM-4.7 (GLM-5 release comparison)Z.ai93.5Original record
Gemini 3 Pro (GLM-5 release comparison)Google93Original record
Claude Opus 4.5 (GLM-5 release comparison)Anthropic91.7Original record
Kimi K2.5 (GLM-5 release comparison)Moonshot AI91.1Original record
DeepSeek V3.2 (GLM-5 release comparison)DeepSeek90.2Original record
AA-LCR / MiniMax report7 results

Vendor-reported model resultMiniMax (internal evaluation)

Reasoning across long inputs.

scoreHigher is better
AA-LCR / MiniMax report / score
Model and configurationScoreSource
Claude Opus 4.5 (MiniMax internal evaluation)Anthropic74Original record
GPT-5.2 (Thinking; MiniMax internal evaluation)OpenAI73Original record
Claude Opus 4.6 (MiniMax internal evaluation)Anthropic71Original record
Gemini 3 Pro (MiniMax internal evaluation)Google71Original record
MiniMax-M2.5 (MiniMax internal evaluation)MiniMax69.5Original record
Claude Sonnet 4.5 (MiniMax internal evaluation)Anthropic66Original record
MiniMax-M2.1 (MiniMax internal evaluation)MiniMax62Original record
HLE no tools / DeepSeek GA report8 results

Vendor-reported model resultDeepSeek (GA model-card report)

Reasoning across disciplines without tools.

scoreHigher is better
HLE no tools / DeepSeek GA report / score
Model and configurationScoreSource
Fable-5 (w/ fallback) (No tools; HLE reasoning effort and token budget not disclosed; with fallback, details unspecified)Anthropic53.3Original record
Opus-4.8 (No tools; HLE reasoning effort and token budget not disclosed)Anthropic49.8Original record
Kimi K3 (No tools; HLE reasoning effort and token budget not disclosed)Moonshot AI43.5Original record
DeepSeek-V4-Pro-0813 (No tools; HLE reasoning effort and token budget not disclosed)DeepSeek42.7Original record
GLM-5.2 (No tools; HLE reasoning effort and token budget not disclosed)Z.ai40.5Original record
DeepSeek-V4-Flash-0731 (No tools; HLE reasoning effort and token budget not disclosed)DeepSeek37.8Original record
DeepSeek-V4-Pro (Preview) (No tools; HLE reasoning effort and token budget not disclosed)DeepSeek37.7Original record
DeepSeek-V4-Flash (Preview) (No tools; HLE reasoning effort and token budget not disclosed)DeepSeek34.8Original record
HLE with tools / DeepSeek GA report8 results

Vendor-reported model resultDeepSeek (GA model-card report)

Reasoning across disciplines with tools.

scoreHigher is better
HLE with tools / DeepSeek GA report / score
Model and configurationScoreSource
Fable-5 (w/ fallback) (With tools; specific tools, HLE reasoning effort and token budget not disclosed; with fallback, details unspecified)Anthropic63Original record
DeepSeek-V4-Pro-0813 (With tools; specific tools, HLE reasoning effort and token budget not disclosed)DeepSeek60Original record
Opus-4.8 (With tools; specific tools, HLE reasoning effort and token budget not disclosed)Anthropic57.9Original record
Kimi K3 (With tools; specific tools, HLE reasoning effort and token budget not disclosed)Moonshot AI56Original record
GLM-5.2 (With tools; specific tools, HLE reasoning effort and token budget not disclosed)Z.ai54.7Original record
DeepSeek-V4-Flash-0731 (With tools; specific tools, HLE reasoning effort and token budget not disclosed)DeepSeek51.5Original record
DeepSeek-V4-Pro (Preview) (With tools; specific tools, HLE reasoning effort and token budget not disclosed)DeepSeek48.2Original record
DeepSeek-V4-Flash (Preview) (With tools; specific tools, HLE reasoning effort and token budget not disclosed)DeepSeek45.1Original record
HMMT February 2026 / DeepSeek Preview report6 results

Vendor-reported model resultDeepSeek (Preview technical report)

Mathematics competition problems, measured by Pass@1.

%Higher is better
HMMT February 2026 / DeepSeek Preview report / %
Model and configurationScoreSource
GPT-5.4 xHigh (xHigh; DeepSeek Preview report comparison)OpenAI97.7%Original record
Opus-4.6 Max (Max; DeepSeek Preview report comparison)Anthropic96.2%Original record
DS-V4-Pro Max (Preview; Max; temperature=1.0; 384K-token context; distinct rigorous-proof math prompt)DeepSeek95.2%Original record
Gemini-3.1-Pro High (High; DeepSeek Preview report comparison)Google94.7%Original record
K2.6 Thinking (Thinking; DeepSeek Preview report comparison)Moonshot AI92.7%Original record
GLM-5.1 Thinking (Thinking; DeepSeek Preview report comparison)Z.ai89.4%Original record
LongBench v2 / Qwen3.8-Max report4 results

Vendor-reported model resultQwen (model-card report)

Reading and reasoning over long documents and inputs.

scoreHigher is better
LongBench v2 / Qwen3.8-Max report / score
Model and configurationScoreSource
Opus 4.8 (LongBench v2; tools, reasoning effort and token budget not disclosed)Anthropic69.1Original record
GPT 5.6 Sol (max) (max (table header); LongBench v2 tools and token budget not disclosed)OpenAI67.1Original record
Qwen3.8-Max service model; LongBench v2 tools, reasoning effort and token budget not disclosedQwen66.3Original record
Qwen3.7-Max (LongBench v2; tools, reasoning effort and token budget not disclosed)Qwen65.3Original record
GPQA Diamond / Google G31 (2026-02-19)5 results

Vendor-reported model resultGoogle DeepMind (Gemini 3.1 Pro release comparison)

Scientific knowledge and reasoning without tools.

%Higher is better
GPQA Diamond / Google G31 (2026-02-19) / %
Model and configurationScoreSource
Gemini 3.1 Pro (Thinking (High); No tools)Google94.3%Original record
GPT-5.2 (Thinking (xhigh); No tools)OpenAI92.4%Original record
Gemini 3 Pro (Thinking (High); No tools)Google91.9%Original record
Claude Opus 4.6 (Thinking (Max); No tools)Anthropic91.3%Original record
Claude Sonnet 4.6 (Thinking (Max); No tools)Anthropic89.9%Original record
HLE, no tools / Google G31 (2026-02-19)5 results

Vendor-reported model resultGoogle DeepMind (Gemini 3.1 Pro release comparison)

Expert-level reasoning on the full text and multimodal HLE set without tools.

%Higher is better
HLE, no tools / Google G31 (2026-02-19) / %
Model and configurationScoreSource
Gemini 3.1 Pro (Thinking (High); No tools)Google44.4%Original record
Claude Opus 4.6 (Thinking (Max); No tools)Anthropic40%Original record
Gemini 3 Pro (Thinking (High); No tools)Google37.5%Original record
GPT-5.2 (Thinking (xhigh); No tools)OpenAI34.5%Original record
Claude Sonnet 4.6 (Thinking (Max); No tools)Anthropic33.2%Original record
HLE, search and code / Google G31 (2026-02-19)5 results

Vendor-reported model resultGoogle DeepMind (Gemini 3.1 Pro release comparison)

Expert-level HLE reasoning with search and code execution.

%Higher is better
HLE, search and code / Google G31 (2026-02-19) / %
Model and configurationScoreSource
Claude Opus 4.6 (Thinking (Max); Search and code; provider-specific tools)Anthropic53.1%Original record
Gemini 3.1 Pro (Thinking (High); Search and code; provider-specific tools)Google51.4%Original record
Claude Sonnet 4.6 (Thinking (Max); Search and code; provider-specific tools)Anthropic49%Original record
Gemini 3 Pro (Thinking (High); Search and code; provider-specific tools)Google45.8%Original record
GPT-5.2 (Thinking (xhigh); Search and code; provider-specific tools)OpenAI45.5%Original record
ARC-AGI-2 / Google G31 (2026-02-19)5 results

Vendor-reported model resultGoogle DeepMind (Gemini 3.1 Pro release comparison)

Inferring unfamiliar patterns from example grids.

%Higher is better
ARC-AGI-2 / Google G31 (2026-02-19) / %
Model and configurationScoreSource
Gemini 3.1 Pro (Thinking (High); ARC Prize Verified; semi-private set)Google77.1%Original record
Claude Opus 4.6 (Thinking (Max); ARC Prize Verified; semi-private set)Anthropic68.8%Original record
Claude Sonnet 4.6 (Thinking (Max); ARC Prize Verified; semi-private set)Anthropic58.3%Original record
GPT-5.2 (Thinking (xhigh); ARC Prize Verified; semi-private set)OpenAI52.9%Original record
Gemini 3 Pro (Thinking (High); ARC Prize Verified; semi-private set)Google31.1%Original record
AIME 2025, no tools / Google G3F (2025-12-17)7 results

Vendor-reported model resultGoogle DeepMind (Gemini 3 Flash release comparison)

Mathematics from the 2025 AIME competition.

%Higher is better
AIME 2025, no tools / Google G3F (2025-12-17) / %
Model and configurationScoreSource
GPT-5.2 (Extra high; No tools)OpenAI100%Original record
Gemini 3 Flash (Thinking; exact level unspecified; No tools)Google95.2%Original record
Gemini 3 Pro (Thinking; exact level unspecified; No tools)Google95%Original record
Grok 4.1 Fast (Reasoning; No tools)xAI91.9%Original record
Gemini 2.5 Pro (Thinking; exact level unspecified; No tools)Google88%Original record
Claude Sonnet 4.5 (Thinking; high preferred, otherwise best available reported setting; No tools)Anthropic87%Original record
Gemini 2.5 Flash (Thinking; exact level unspecified; No tools)Google72%Original record
AIME 2025, code execution / Google G3F (2025-12-17)4 results

Vendor-reported model resultGoogle DeepMind (Gemini 3 Flash release comparison)

Mathematics from the 2025 AIME competition.

%Higher is better
AIME 2025, code execution / Google G3F (2025-12-17) / %
Model and configurationScoreSource
Gemini 3 Pro (Thinking; exact level unspecified; Code execution)Google100%Original record
Claude Sonnet 4.5 (Thinking; high preferred, otherwise best available reported setting; Code execution)Anthropic100%Original record
Gemini 3 Flash (Thinking; exact level unspecified; Code execution)Google99.7%Original record
Gemini 2.5 Flash (Thinking; exact level unspecified; Code execution)Google75.7%Original record
HLE, no tools / Anthropic A51 (2026-09-01)3 results

Vendor-reported model resultAnthropic (Fable 5.1 release comparison)

Original HLE reasoning on 2,500 multimodal questions without tools.

%Higher is better
HLE, no tools / Anthropic A51 (2026-09-01) / %
Model and configurationScoreSource
Claude Fable 5.1 (Adaptive thinking (auto); max effort; default sampling; five-trial mean; total token cap 1M; no compaction; production safeguards enabled; No tools)Anthropic60.9%Original record
Claude Fable 5 (Detailed reasoning setting and budget unverified; production safeguards enabled; No tools)Anthropic57.8%Original record
Claude Opus 5 (Detailed reasoning setting and budget unverified; No tools)Anthropic56.6%Original record
HLE, tools / Anthropic A51 (2026-09-01)3 results

Vendor-reported model resultAnthropic (Fable 5.1 release comparison)

Original HLE reasoning with search, web retrieval and code tools.

%Higher is better
HLE, tools / Anthropic A51 (2026-09-01) / %
Model and configurationScoreSource
Claude Fable 5.1 (Adaptive thinking (auto); max effort; default sampling; five-trial mean; total token cap 1M; no compaction; production safeguards enabled; Search; restricted fetch; programmatic tool calling; code execution)Anthropic65%Original record
Claude Fable 5 (Detailed reasoning setting and budget unverified; production safeguards enabled; Search; restricted fetch; programmatic tool calling; code execution)Anthropic63.8%Original record
Claude Opus 5 (Detailed reasoning setting and budget unverified; Search; restricted fetch; programmatic tool calling; code execution)Anthropic63.6%Original record
ARC-AGI-2 / Anthropic A51 (2026-09-01)4 results

Vendor-reported model resultAnthropic (Fable 5.1 release comparison)

Novel grid-pattern reasoning in the September release comparison.

%Higher is better
ARC-AGI-2 / Anthropic A51 (2026-09-01) / %
Model and configurationScoreSource
GPT-5.6 Sol (Exact reasoning setting and token budget unverified)OpenAI92.5%Original record
Claude Opus 5 (Exact reasoning setting and token budget unverified)Anthropic90.42%Original record
Claude Fable 5.1 / Claude Mythos 5.1 (Fable 5.1: max effort; semi-private set; ARC Prize Verified)Anthropic90%Original record
Claude Fable 5 / Claude Mythos 5 (Exact reasoning setting and token budget unverified)Anthropic89.2%Original record
HLE-Verified / Google G38 (2026-09-02)6 results

Vendor-reported model resultGoogle DeepMind (Gemini 3.8 Flash release comparison)

Expert reasoning on a verified and revised 1,811-question set.

%Higher is better
HLE-Verified / Google G38 (2026-09-02) / %
Model and configurationScoreSource
Gemini 3.8 Flash (Default sampling; exact thinking level unspecified; HLE-Verified; 1811 items; tool use unspecified)Google54.9%Original record
GPT-5.6 Sol (Exact reasoning level unspecified; HLE-Verified; 1811 items; tool use unspecified)OpenAI54.5%Original record
Claude Opus 5 (Exact thinking level unspecified; HLE-Verified; 1811 items; tool use unspecified)Anthropic54.4%Original record
Gemini 3.7 Flash (Exact thinking level unspecified; HLE-Verified; 1811 items; tool use unspecified)Google53.6%Original record
GPT-5.6 Terra (Maximum reasoning preferred; otherwise best available reported setting; HLE-Verified; 1811 items; tool use unspecified)OpenAI51.1%Original record
Claude Sonnet 5 (Maximum thinking preferred; otherwise best available reported setting; HLE-Verified; 1811 items; tool use unspecified)Anthropic31%Original record

Documents and context

AA-LCR v1.115 results

Base model resultArtificial Analysis

Long-context reasoning

%Higher is better
AA-LCR v1.1 / %
Model and configurationScoreSource
Kimi K3 (max)Kimi88.67%Original record
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic85.33%Original record
Muse Spark 1.3 (max)Meta84.33%Original record
Gemini 3.8 Flash (medium)Google84%Original record
GPT-5.6 Sol (max)OpenAI84%Original record
GPT-5.6 Luna (max)OpenAI83.67%Original record
Muse Glimmer (high)Meta83.33%Original record
GPT-5.3 Codex (xhigh)OpenAI83.33%Original record
MiniMax-M3MiniMax83%Original record
GPT-5.6 Terra (max)OpenAI83%Original record
Gemini 3.7 Flash (medium)Google83%Original record
Agnes 2.5 Pro BetaSapiens AI83%Original record
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic82.33%Original record
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic82%Original record
Qwen3.8 27B (xhigh)Alibaba82%Original record
MMMU-Pro15 results

Base model resultArtificial Analysis

Visual reasoning

%Higher is better
MMMU-Pro / %
Model and configurationScoreSource
GPT-6 Astra (max)OpenAI86.88%Original record
Gemini 3.8 Flash (high)Google85.61%Original record
Gemini 3.7 Flash (high)Google85.49%Original record
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic84.74%Original record
Gemini 3.5 Flash (medium)Google83.87%Original record
GPT-5.6 Sol (max)OpenAI83.41%Original record
Gemini 3.6 Flash (high)Google83.24%Original record
Gemini 3.1 Pro PreviewGoogle82.43%Original record
Qwen3.8 MaxAlibaba82.31%Original record
Muse Spark 1.3 (xhigh)Meta82.02%Original record
GPT-5.6 Terra (max)OpenAI80.69%Original record
Kimi K3 (max)Kimi80.52%Original record
Qwen3.7 PlusAlibaba80.46%Original record
Grok 4.5 (high)SpaceXAI80.4%Original record
Qwen3.8-Flash-NextAlibaba79.77%Original record
AA-Omniscience / Index15 results

Base model resultArtificial Analysis

Knowledge reliability

scoreHigher is better
AA-Omniscience / Index / score
Model and configurationScoreSource
GPT-6 Astra (high)OpenAI43.73Original record
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic43.45Original record
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic43.3Original record
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic37.07Original record
Gemini 3.1 Pro PreviewGoogle31.88Original record
Grok 4.6 (high)SpaceXAI30.48Original record
Gemini 3.8 Flash (high)Google29.55Original record
Muse Spark 1.2 (xhigh)Meta27.2Original record
Gemini 3.7 Flash (high)Google26.48Original record
Grok 4.5 (high)SpaceXAI25.32Original record
Muse Spark 1.3 (max)Meta24.93Original record
Gemini 3.6 Flash (high)Google22.13Original record
GPT-5.6 Sol (max)OpenAI21.97Original record
Gemini 3.5 Flash (medium)Google20.82Original record
Kimi K3 (max)Kimi19.7Original record
AA-Omniscience / Accuracy15 results

Base model resultArtificial Analysis

Correct knowledge answers

%Higher is better
AA-Omniscience / Accuracy / %
Model and configurationScoreSource
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic67.23%Original record
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic65.35%Original record
GPT-6 Astra (max)OpenAI62.6%Original record
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic60.87%Original record
GPT-5.6 Sol (max)OpenAI59.4%Original record
Gemini 3.7 Flash (high)Google55.32%Original record
Gemini 3.1 Pro PreviewGoogle54.85%Original record
Gemini 3.8 Flash (high)Google54.6%Original record
GPT-5.3 Codex (xhigh)OpenAI52.88%Original record
Grok 4.5 (high)SpaceXAI51.55%Original record
Gemini 3.5 Flash (medium)Google51.05%Original record
Gemini 3.6 Flash (high)Google49.97%Original record
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek49.1%Original record
Grok 4.6 (high)SpaceXAI48.23%Original record
Kimi K3 (max)Kimi47.58%Original record
AA-Omniscience / Hallucination15 results

Base model resultArtificial Analysis

Hallucination rate, lower is better

%Lower is better
AA-Omniscience / Hallucination / %
Model and configurationScoreSource
MiniCPM5-1B (Non-reasoning)OpenBMB0.9%Original record
G9v3-3BAI9Stars11.66%Original record
G9v3-39A5BAI9Stars13.04%Original record
Command A+Cohere14.16%Original record
LFM2.5-2.6BLiquid AI16%Original record
Grok 4.3 (medium)SpaceXAI16.94%Original record
Qwen3.8 27B (Non-reasoning)Alibaba18.09%Original record
MiniMax-M3MiniMax18.43%Original record
Quasar 438B (max, based on GLM-5.2)Multiverse Computing21.44%Original record
K-EXAONE 2.0 0803 (K-EXAONE 2.0)LG AI Research22.6%Original record
Grok 4.6 (medium)SpaceXAI24%Original record
Solar Pro 4Upstage24.4%Original record
MiMo-V2.5-ProXiaomi24.7%Original record
Solar Open2 250BUpstage25.38%Original record
Granite 4.2 30BIBM25.58%Original record
MathVision / Moonshot report5 results

Vendor-reported model resultMoonshot AI (model-card report)

Mathematics from visual problems.

scoreHigher is better
MathVision / Moonshot report / score
Model and configurationScoreSource
Gemini 3 Pro (High Thinking Level; publisher rerun (*))Google86.1Original record
Kimi K2.5 (Thinking)Moonshot AI84.2Original record
GPT-5.2 (xhigh)OpenAI83Original record
Claude Opus 4.5 (Extended Thinking; publisher rerun (*))Anthropic77.1Original record
Qwen3-VL-235B-A22B (Thinking)Qwen74.6Original record
OCRBench / Moonshot report5 results

Vendor-reported model resultMoonshot AI (model-card report)

Text recognition in images.

scoreHigher is better
OCRBench / Moonshot report / score
Model and configurationScoreSource
Kimi K2.5 (Thinking)Moonshot AI92.3Original record
Gemini 3 Pro (High Thinking Level; publisher rerun (*))Google90.3Original record
Qwen3-VL-235B-A22B (Thinking)Qwen87.5Original record
Claude Opus 4.5 (Extended Thinking; publisher rerun (*))Anthropic86.5Original record
GPT-5.2 (xhigh; publisher rerun (*))OpenAI80.7Original record
OmniDocBench 1.5 / Moonshot report5 results

Vendor-reported model resultMoonshot AI (model-card report)

Document reading. The reported score is (1 − normalized edit distance) × 100.

scoreHigher is better
OmniDocBench 1.5 / Moonshot report / score
Model and configurationScoreSource
Kimi K2.5 (Thinking)Moonshot AI88.8Original record
Gemini 3 Pro (High Thinking Level)Google88.5Original record
Claude Opus 4.5 (Extended Thinking; publisher rerun (*))Anthropic87.7Original record
GPT-5.2 (xhigh)OpenAI85.7Original record
Qwen3-VL-235B-A22B (Thinking; publisher rerun (*))Qwen82Original record
VideoMMMU / Moonshot report5 results

Vendor-reported model resultMoonshot AI (model-card report)

Video understanding across subjects.

scoreHigher is better
VideoMMMU / Moonshot report / score
Model and configurationScoreSource
Gemini 3 Pro (High Thinking Level)Google87.6Original record
Kimi K2.5 (Thinking)Moonshot AI86.6Original record
GPT-5.2 (xhigh)OpenAI85.9Original record
Claude Opus 4.5 (Extended Thinking; publisher rerun (*))Anthropic84.4Original record
Qwen3-VL-235B-A22B (Thinking)Qwen80Original record
MotionBench / Moonshot report4 results

Vendor-reported model resultMoonshot AI (model-card report)

Understanding motion in video.

scoreHigher is better
MotionBench / Moonshot report / score
Model and configurationScoreSource
Kimi K2.5 (Thinking)Moonshot AI70.4Original record
Gemini 3 Pro (High Thinking Level)Google70.3Original record
GPT-5.2 (xhigh)OpenAI64.8Original record
Claude Opus 4.5 (Extended Thinking)Anthropic60.3Original record
IFBench / MiniMax report7 results

Vendor-reported model resultMiniMax (internal evaluation)

Following detailed instructions.

scoreHigher is better
IFBench / MiniMax report / score
Model and configurationScoreSource
GPT-5.2 (Thinking; MiniMax internal evaluation)OpenAI75Original record
MiniMax-M2.5 (MiniMax internal evaluation)MiniMax70Original record
MiniMax-M2.1 (MiniMax internal evaluation)MiniMax70Original record
Gemini 3 Pro (MiniMax internal evaluation)Google70Original record
Claude Opus 4.5 (MiniMax internal evaluation)Anthropic58Original record
Claude Sonnet 4.5 (MiniMax internal evaluation)Anthropic57Original record
Claude Opus 4.6 (MiniMax internal evaluation)Anthropic53Original record
MMMLU / DeepSeek Base report3 results

Vendor-reported model resultDeepSeek (Base technical report)

Multilingual knowledge, measured by exact match with five examples.

%Higher is better
MMMLU / DeepSeek Base report / %
Model and configurationScoreSource
DeepSeek-V4-Pro-Base (Base; MMMLU EM; 5-shot; shared internal evaluation setup; sampling and tools not disclosed)DeepSeek90.3%Original record
DeepSeek-V4-Flash-Base (Base; MMMLU EM; 5-shot; shared internal evaluation setup; sampling and tools not disclosed)DeepSeek88.8%Original record
DeepSeek-V3.2-Base (Base; MMMLU EM; 5-shot; shared internal evaluation setup; sampling and tools not disclosed)DeepSeek87.9%Original record
OmniDocBench 1.5 / Qwen3.8-27B report5 results

Vendor-reported model resultQwen (model-card report)

Reading document images, using the publisher's reported score.

scoreHigher is better
OmniDocBench 1.5 / Qwen3.8-27B report / score
Model and configurationScoreSource
Qwen3.7-Plus (OmniDocBench 1.5; tools, reasoning effort and image settings not disclosed)Qwen91.4Original record
Qwen3.8-27B (OmniDocBench 1.5; tools, reasoning effort and image settings not disclosed)Qwen91.1Original record
Qwen3.6-27B (OmniDocBench 1.5; tools, reasoning effort and image settings not disclosed)Qwen89.4Original record
Opus4.6 Max (Max (table header); OmniDocBench 1.5 tools and image settings not disclosed)Anthropic86.6Original record
Muse Glimmer-30B (OmniDocBench 1.5; tools, reasoning effort and image settings not disclosed)Meta75.8Original record
MMMU-Pro / Google G31 (2026-02-19)5 results

Vendor-reported model resultGoogle DeepMind (Gemini 3.1 Pro release comparison)

Multimodal understanding and reasoning without tools.

%Higher is better
MMMU-Pro / Google G31 (2026-02-19) / %
Model and configurationScoreSource
Gemini 3 Pro (Thinking (High); No tools; Standard (10 options) and Vision average)Google81%Original record
Gemini 3.1 Pro (Thinking (High); No tools; Standard (10 options) and Vision average)Google80.5%Original record
GPT-5.2 (Thinking (xhigh); No tools; Standard (10 options) and Vision average)OpenAI79.5%Original record
Claude Sonnet 4.6 (Thinking (Max); No tools; Standard (10 options) and Vision average)Anthropic74.5%Original record
Claude Opus 4.6 (Thinking (Max); No tools; Standard (10 options) and Vision average)Anthropic73.9%Original record
MRCR v2, 128k / Google G31 (2026-02-19)5 results

Vendor-reported model resultGoogle DeepMind (Gemini 3.1 Pro release comparison)

Retrieving eight target items from long context, averaged up to 128k tokens.

%Higher is better
MRCR v2, 128k / Google G31 (2026-02-19) / %
Model and configurationScoreSource
Gemini 3.1 Pro (Thinking (High); MRCR v2; 8 needles; 128k cumulative average)Google84.9%Original record
Claude Sonnet 4.6 (Thinking (Max); MRCR v2; 8 needles; 128k cumulative average)Anthropic84.9%Original record
Claude Opus 4.6 (Thinking (Max); MRCR v2; 8 needles; 128k cumulative average)Anthropic84%Original record
GPT-5.2 (Thinking (xhigh); MRCR v2; 8 needles; 128k cumulative average)OpenAI83.8%Original record
Gemini 3 Pro (Thinking (High); MRCR v2; 8 needles; 128k cumulative average)Google77%Original record
MRCR v2, 1M / Google G31 (2026-02-19)2 results

Vendor-reported model resultGoogle DeepMind (Gemini 3.1 Pro release comparison)

Retrieving eight target items at the 1M-token context point.

%Higher is better
  1. Gemini 3.1 Pro26.3%
  2. Gemini 3 Pro26.3%
MRCR v2, 1M / Google G31 (2026-02-19) / %
Model and configurationScoreSource
Gemini 3.1 Pro (Thinking (High); MRCR v2; 8 needles; 1M pointwise)Google26.3%Original record
Gemini 3 Pro (Thinking (High); MRCR v2; 8 needles; 1M pointwise)Google26.3%Original record
CharXiv Reasoning / Google G38 (2026-09-02)6 results

Vendor-reported model resultGoogle DeepMind (Gemini 3.8 Flash release comparison)

Combining information from complex charts without tools.

%Higher is better
CharXiv Reasoning / Google G38 (2026-09-02) / %
Model and configurationScoreSource
Gemini 3.8 Flash (Default sampling; exact thinking level unspecified; No tools)Google86.2%Original record
GPT-5.6 Terra (Maximum reasoning preferred; otherwise best available reported setting; No tools)OpenAI85.9%Original record
GPT-5.6 Sol (Exact reasoning level unspecified; No tools)OpenAI85.8%Original record
Gemini 3.7 Flash (Exact thinking level unspecified; No tools)Google84.5%Original record
Claude Opus 5 (Exact thinking level unspecified; No tools)Anthropic83.7%Original record
Claude Sonnet 5 (Maximum thinking preferred; otherwise best available reported setting; No tools)Anthropic70.1%Original record

Retrieval models

MTEB / OpenAI embeddings report3 results

Retrieval model resultOpenAI (developer documentation)

Text embedding evaluation, separate from generative model reasoning.

%Higher is better
MTEB / OpenAI embeddings report / %
Model and configurationScoreSource
text-embedding-3-large (Published MTEB result; evaluation dimensions unspecified)OpenAI64.6%Original record
text-embedding-3-small (Published MTEB result; evaluation dimensions unspecified)OpenAI62.3%Original record
text-embedding-ada-002 (Published MTEB result; evaluation dimensions unspecified)OpenAI61%Original record

Time and cost

Intelligence Index / Cost per task15 results

Base model resultArtificial Analysis

Weighted cost per evaluation task

USDLower is better
Intelligence Index / Cost per task / USD
Model and configurationScoreSource
GLM 5.3 Flash (GLM-5.3-Flash)Z AI0.18Original record
Muse Spark 1.2 (xhigh)Meta0.55Original record
Gemini 3.8 Flash (high)Google0.74Original record
GPT-5.6 Terra (max)OpenAI0.81Original record
Muse Spark 1.3 (max)Meta0.96Original record
Qwen3.8 2.4T A95BAlibaba1.1Original record
Qwen3.8 MaxAlibaba1.19Original record
GPT-5.6 Sol (max)OpenAI1.25Original record
Grok 4.6 (high)SpaceXAI1.25Original record
GLM-5.3 (max)Z AI1.26Original record
Kimi K3 (max)Kimi1.58Original record
GPT-6 Astra (max)OpenAI2.57Original record
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic4.21Original record
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic5.62Original record
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic6.12Original record
Output speed15 results

Base model resultArtificial Analysis

Output generation speed

tokens/sHigher is better
Output speed / tokens/s
Model and configurationScoreSource
Gemini 3.8 Flash (high)Google280.76Original record
Muse Spark 1.2 (xhigh)Meta269.24Original record
Muse Spark 1.3 (max)Meta233.15Original record
GPT-5.6 Terra (max)OpenAI113.93Original record
GLM-5.3 (max)Z AI83.31Original record
GPT-5.6 Sol (max)OpenAI75.78Original record
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic68.22Original record
GPT-6 Astra (max)OpenAI64.26Original record
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic62.97Original record
Grok 4.6 (high)SpaceXAI59.89Original record
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic55.95Original record
GLM 5.3 Flash (GLM-5.3-Flash)Z AI50.63Original record
Kimi K3 (max)Kimi41.61Original record
Qwen3.8 2.4T A95BAlibaba40.23Original record
Qwen3.8 MaxAlibaba40.15Original record
API input price15 results

Base model resultArtificial Analysis

Price per million input tokens

USD / 1MLower is better
API input price / USD / 1M
Model and configurationScoreSource
GLM 5.3 Flash (GLM-5.3-Flash)Z AI0.15Original record
Gemini 3.8 Flash (high)Google0.75Original record
Muse Spark 1.3 (max)Meta1.25Original record
Muse Spark 1.2 (xhigh)Meta1.25Original record
GLM-5.3 (max)Z AI1.4Original record
Grok 4.6 (high)SpaceXAI2Original record
Qwen3.8 MaxAlibaba2Original record
GPT-5.6 Terra (max)OpenAI2Original record
Qwen3.8 2.4T A95BAlibaba2Original record
Kimi K3 (max)Kimi3Original record
GPT-5.6 Sol (max)OpenAI4Original record
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic5Original record
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic10Original record
GPT-6 Astra (max)OpenAI10Original record
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic10Original record
API output price15 results

Base model resultArtificial Analysis

Price per million output tokens

USD / 1MLower is better
API output price / USD / 1M
Model and configurationScoreSource
GLM 5.3 Flash (GLM-5.3-Flash)Z AI0.5Original record
Gemini 3.8 Flash (high)Google3.75Original record
Muse Spark 1.3 (max)Meta4.25Original record
Muse Spark 1.2 (xhigh)Meta4.25Original record
GLM-5.3 (max)Z AI4.4Original record
Grok 4.6 (high)SpaceXAI6Original record
Qwen3.8 MaxAlibaba6Original record
Qwen3.8 2.4T A95BAlibaba6Original record
GPT-5.6 Terra (max)OpenAI12Original record
Kimi K3 (max)Kimi15Original record
GPT-5.6 Sol (max)OpenAI20Original record
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic25Original record
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic50Original record
GPT-6 Astra (max)OpenAI50Original record
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic50Original record

Sources and further reading

  1. Anthropic. Demystifying evals for AI agents
  2. OpenAI. GDPval
  3. OpenAI. BrowseComp
  4. Parallel. Deep Research price-performance
  5. LangChain. Improving Deep Agents with harness engineering
  6. LangChain. Deep Agents source code
  7. DeepResearch Bench II. Evaluation code
  8. ResearchRubrics. Evaluation code
  9. Agents’ Last Exam. Tasks and evaluation