HDATF RESEARCH / 基准评测报告
如何验证AI 能否完成实际工作
公开成绩能说明什么,哪些问题必须通过实际运行验证。 从模型选择到调研、文档编写与成果检验。
核心结论
公开评测为模型选择和测试设计提供依据。能否投入工作,还要连接实际资料和工具,检验系统是否完成所要求的成果。
本报告从可用成果、可核查证据和完整执行三个角度解读公开成绩。HDATF尚未公布这些评测的自身实测成绩,最后一章将说明验证这一差距的计划。
73 评测与指标684 归档成绩
先确定要交付的工作,再阅读分数。
基准评测用规定的任务和评分规则比较能力。推理题、文档比较和工具操作分别考察不同能力,读分数时应先明确测试对象。
报告任务需要文件可打开、论点有据可查、内容符合要求。数据分析还需要能用提供的数据重现结果。通用模型排名无法单独验证这些条件。
公开成绩用于缩小候选范围并确定要测试的失败类型。选择用于LabChin的方法时,需要结合自己的资料、权限、工具与成果检查。本报告依次讨论成果、证据和执行。[1]
按实际任务要求评价成果。
GDPval比较专业工作成果。最初的Gold研究涵盖44个职业的220项任务,由专家在不知道作者的情况下比较。下图展示归档的三项结果。
胜出与持平比例反映这些成果比较,不能换算为企业可交给AI的工作比例。任务范围、专家判断和模型配置限定了结论。[2]
GDPval Gold
相对专家成果的胜出与持平比例 (%)
- Claude Opus 4.147.6%
- GPT-5 (high)38.8%
- o3 (high)34.1%
44 个职业的 220 项 Gold 任务。原始研究由专家盲评比较成果,不代表当前排名。
HDATF需要确认文件生成后还有多少人工工作。应保留遗漏要求、无依据数值和人工修改。易读的布局是质量的一部分,但不能弥补错误证据或不可用文件。
同时检查寻找答案和提供依据的能力。
BrowseComp测试寻找难查事实的能力。Parallel从1,266题中随机抽取100题,报告正确率与请求成本。以下成绩来自服务提供方对部分题目的实验。[3][4]
BrowseComp / Parallel study
正确率 (%)
从 1,266 题随机抽取 100 题。Parallel 于 2025 年 8 月 11 至 29 日测量。每次费用:Ultra8x $2.40、Ultra $0.30、GPT-5 $0.488。配置与预算不同。
Ultra8x报告每次2.40美元、正确率58%,Ultra为0.30美元、45%。预算不同,这些数值呈现准确率与成本关系,但不能证明同等成本下的优势或基础模型的独立效果。
调研报告需要额外检查。DeepResearch Bench II和ResearchRubrics依据明确标准评估内容。LabChin计划保留支持主要论点的原文、矛盾资料及未回答的问题。
同一模型,执行方式不同,结果也会改变。
执行框架向模型提供工具、上下文并控制任务。LangChain固定GPT-5.2-Codex,仅修改周边执行方式,89项Terminal-Bench 2.0任务的成绩从52.8%升至66.5%。[5][6]
Terminal-Bench 2.0
任务成功率 (%)
89 项任务。LangChain 固定 GPT-5.2-Codex,修改提示、工具及执行控制,使用 Harbor / Daytona。公布提升为 13.7 个百分点。
实验同时改变指令、工具和执行控制,包括结束前检查与环境说明。13.7个百分点属于组合修改的结果,无法据此确定各功能贡献或预测HDATF的提升。
可以固定自己的任务与模型,对比有无成果检查的流程。保留文件、检查结果、重试和耗时,同时解释成功及需要人工干预的失败,才能判断执行差异。
记忆需要独立测试。回忆旧信息还不够,也要处理修正和访问范围。归档的LoCoMo结果仅限单跳事实回忆,不能视为已验证更新冲突或用户隔离,因此列入附录供参考。
下一步验证HDATF实际完成的工作。
公开研究有助于整理问题,产品成绩仍需直接测量。计划记录代表任务的执行条件,分别评估证据检索、分析和成果交付,避免某一项高分掩盖其他失败。
调研和数据工作应保留问题、资料版本及最终成果检查记录。报告需暴露无依据论点,分析需保存输入数据、运行记录与可重现成果。以下是待验证的标准,并非已完成测试。[1][7][8][9]
这是评测计划,HDATF实测成绩尚未公布。
能否找到所需证据
BrowseComp评估查找网络中难以找到的事实的能力。LabChin还计划单独检查引用来源是否真正支持相应论点。
能否依据证据回答问题
以DeepResearch Bench II和ResearchRubrics作为调研报告的评估参考。不只看行文流畅,还计划检查内容覆盖、事实依据和结论的分析过程。
能否交付可用成果
GDPval和Agents’ Last Exam面向专业任务。计划检查请求是否完成、文件能否使用,以及还需要多少人工修正。
| 评测对象 | 保留的证据 | 支持的判断 |
|---|---|---|
| 任务 | 任务要求、输入文件、完成标准 | 所要求的工作是否完成 |
| 执行 | 模型、工具、权限、执行配置版本 | 能否以相同条件重新运行 |
| 结果 | 成果文件、来源检查、人工修改 | 成果是否正确且可用 |
| 效率 | 总耗时、工具使用、重试、总成本 | 整个流程的时间与成本是否可承担 |
附录。完整评测资料
按评测比较公开成绩,点击模型名称查看原文。数据以标注日期为准,模型系列比较采用各系列成绩最好的配置。
73 / 73 评测与指标
工作与文档
AA-Briefcase15 项成绩
长期知识工作
- Claude Fable 5.11,661.91
- Claude Opus 51,647.02
- GPT-6 Astra1,561.95
- Muse Spark 1.31,558.85
- Grok 4.61,545.82
- Claude Fable 51,533.52
- GLM-5.31,515.45
- Kimi K31,496.83
- GPT-5.6 Sol1,474.49
- GLM 5.3 Flash1,459.13
- Qwen3.8 2.4T A95B1,442.81
- DeepSeek V4 Flash 07311,433.23
- Qwen3.8 27B1,401.81
- Qwen3.8 Max1,392.33
- Claude Sonnet 51,358.11
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 1,661.91 | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 1,647.02 | 原始记录 |
| GPT-6 Astra (max)OpenAI | 1,561.95 | 原始记录 |
| Muse Spark 1.3 (max)Meta | 1,558.85 | 原始记录 |
| Grok 4.6 (xhigh)SpaceXAI | 1,545.82 | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 1,533.52 | 原始记录 |
| GLM-5.3 (max)Z AI | 1,515.45 | 原始记录 |
| Kimi K3 (max)Kimi | 1,496.83 | 原始记录 |
| GPT-5.6 Sol (max)OpenAI | 1,474.49 | 原始记录 |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 1,459.13 | 原始记录 |
| Qwen3.8 2.4T A95BAlibaba | 1,442.81 | 原始记录 |
| DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek | 1,433.23 | 原始记录 |
| Qwen3.8 27B (xhigh)Alibaba | 1,401.81 | 原始记录 |
| Qwen3.8 MaxAlibaba | 1,392.33 | 原始记录 |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 1,358.11 | 原始记录 |
AA-Briefcase / Rubric15 项成绩
工作要求满足率
- Claude Fable 5.161.52%
- Claude Opus 557.98%
- Claude Fable 555.96%
- Muse Spark 1.354.87%
- Grok 4.653.84%
- GPT-6 Astra52.32%
- GLM-5.351.35%
- Kimi K350.97%
- Qwen3.8 2.4T A95B50%
- Qwen3.8 Max49.6%
- Qwen3.8 27B47.8%
- GLM 5.3 Flash46.36%
- DeepSeek V4 Flash 073146.15%
- Muse Spark 1.245.15%
- DeepSeek V4 Pro 081343.52%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 61.52% | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic | 57.98% | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 55.96% | 原始记录 |
| Muse Spark 1.3 (max)Meta | 54.87% | 原始记录 |
| Grok 4.6 (xhigh)SpaceXAI | 53.84% | 原始记录 |
| GPT-6 Astra (xhigh)OpenAI | 52.32% | 原始记录 |
| GLM-5.3 (max)Z AI | 51.35% | 原始记录 |
| Kimi K3 (max)Kimi | 50.97% | 原始记录 |
| Qwen3.8 2.4T A95BAlibaba | 50% | 原始记录 |
| Qwen3.8 MaxAlibaba | 49.6% | 原始记录 |
| Qwen3.8 27B (xhigh)Alibaba | 47.8% | 原始记录 |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 46.36% | 原始记录 |
| DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek | 46.15% | 原始记录 |
| Muse Spark 1.2 (xhigh)Meta | 45.15% | 原始记录 |
| DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek | 43.52% | 原始记录 |
AA-Briefcase / Analytical quality15 项成绩
分析质量
- Claude Fable 5.11,959.49
- Claude Opus 51,909.74
- GLM-5.31,788.62
- GPT-6 Astra1,753.64
- Muse Spark 1.31,711.52
- Grok 4.61,682.58
- Claude Fable 51,676.55
- Kimi K31,668.89
- GLM 5.3 Flash1,650.95
- Qwen3.8 2.4T A95B1,617.45
- DeepSeek V4 Flash 07311,617.37
- Qwen3.8 27B1,590.24
- GPT-5.6 Sol1,537.92
- Qwen3.8 Max1,533.14
- Claude Sonnet 51,418.22
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 1,959.49 | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 1,909.74 | 原始记录 |
| GLM-5.3 (max)Z AI | 1,788.62 | 原始记录 |
| GPT-6 Astra (max)OpenAI | 1,753.64 | 原始记录 |
| Muse Spark 1.3 (max)Meta | 1,711.52 | 原始记录 |
| Grok 4.6 (xhigh)SpaceXAI | 1,682.58 | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 1,676.55 | 原始记录 |
| Kimi K3 (max)Kimi | 1,668.89 | 原始记录 |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 1,650.95 | 原始记录 |
| Qwen3.8 2.4T A95BAlibaba | 1,617.45 | 原始记录 |
| DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek | 1,617.37 | 原始记录 |
| Qwen3.8 27B (xhigh)Alibaba | 1,590.24 | 原始记录 |
| GPT-5.6 Sol (max)OpenAI | 1,537.92 | 原始记录 |
| Qwen3.8 MaxAlibaba | 1,533.14 | 原始记录 |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 1,418.22 | 原始记录 |
AA-Briefcase / Presentation15 项成绩
成果呈现质量
- GPT-5.6 Sol1,633.93
- Claude Opus 51,544.01
- GPT-6 Astra1,535.29
- GPT-5.6 Terra1,519.13
- Grok 4.61,514.68
- Muse Spark 1.31,506.83
- Claude Fable 5.11,472.7
- GPT-5.6 Luna1,471.03
- Claude Fable 51,456.83
- Kimi K31,435.29
- Claude Sonnet 51,409.5
- GLM 5.3 Flash1,409.12
- DeepSeek V4 Flash 07311,355.99
- GLM-5.31,354.5
- Muse Spark 1.21,334.35
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| GPT-5.6 Sol (max)OpenAI | 1,633.93 | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 1,544.01 | 原始记录 |
| GPT-6 Astra (max)OpenAI | 1,535.29 | 原始记录 |
| GPT-5.6 Terra (max)OpenAI | 1,519.13 | 原始记录 |
| Grok 4.6 (xhigh)SpaceXAI | 1,514.68 | 原始记录 |
| Muse Spark 1.3 (max)Meta | 1,506.83 | 原始记录 |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 1,472.7 | 原始记录 |
| GPT-5.6 Luna (max)OpenAI | 1,471.03 | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 1,456.83 | 原始记录 |
| Kimi K3 (max)Kimi | 1,435.29 | 原始记录 |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 1,409.5 | 原始记录 |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 1,409.12 | 原始记录 |
| DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek | 1,355.99 | 原始记录 |
| GLM-5.3 (max)Z AI | 1,354.5 | 原始记录 |
| Muse Spark 1.2 (xhigh)Meta | 1,334.35 | 原始记录 |
GDPval-AA v215 项成绩
实际职业任务
- Claude Fable 5.11,765.9
- Claude Opus 51,738.08
- Muse Spark 1.31,719.65
- GLM-5.31,678.47
- GLM 5.3 Flash1,672.94
- Grok 4.61,664.82
- Qwen3.8-Flash-Next1,649.93
- Claude Fable 51,635.39
- Qwen3.8 Max1,633.53
- Qwen3.8 2.4T A95B1,630.39
- GPT-5.6 Sol1,625.68
- Kimi K31,585.72
- GPT-6 Astra1,582.24
- DeepSeek V4 Flash 07311,579.3
- Muse Spark 1.21,525.03
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 1,765.9 | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 1,738.08 | 原始记录 |
| Muse Spark 1.3 (max)Meta | 1,719.65 | 原始记录 |
| GLM-5.3 (max)Z AI | 1,678.47 | 原始记录 |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 1,672.94 | 原始记录 |
| Grok 4.6 (xhigh)SpaceXAI | 1,664.82 | 原始记录 |
| Qwen3.8-Flash-NextAlibaba | 1,649.93 | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 1,635.39 | 原始记录 |
| Qwen3.8 MaxAlibaba | 1,633.53 | 原始记录 |
| Qwen3.8 2.4T A95BAlibaba | 1,630.39 | 原始记录 |
| GPT-5.6 Sol (max)OpenAI | 1,625.68 | 原始记录 |
| Kimi K3 (max)Kimi | 1,585.72 | 原始记录 |
| GPT-6 Astra (max)OpenAI | 1,582.24 | 原始记录 |
| DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek | 1,579.3 | 原始记录 |
| Muse Spark 1.2 (xhigh)Meta | 1,525.03 | 原始记录 |
AA-AnalystAgent / pass^515 项成绩
表格与文档分析的重复成功
- Gemini 3.7 Flash60%
- Claude Fable 5.157.5%
- Claude Opus 553.75%
- GPT-6 Astra51.25%
- Claude Fable 548.75%
- GPT-5.6 Sol47.5%
- Claude Sonnet 546.25%
- Gemini 3.1 Pro Preview41.25%
- Grok 4.641.25%
- Kimi K338.75%
- Grok 4.535%
- Inkling Small27.5%
- Inkling23.75%
- MiMo-V2.5-Pro20%
- DeepSeek V4 Pro 042418.75%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Gemini 3.7 Flash (high)Google | 60% | 原始记录 |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 57.5% | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 53.75% | 原始记录 |
| GPT-6 Astra (max)OpenAI | 51.25% | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 48.75% | 原始记录 |
| GPT-5.6 Sol (max)OpenAI | 47.5% | 原始记录 |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 46.25% | 原始记录 |
| Gemini 3.1 Pro PreviewGoogle | 41.25% | 原始记录 |
| Grok 4.6 (high)SpaceXAI | 41.25% | 原始记录 |
| Kimi K3 (max)Kimi | 38.75% | 原始记录 |
| Grok 4.5 (high)SpaceXAI | 35% | 原始记录 |
| Inkling SmallThinking Machines | 27.5% | 原始记录 |
| Inkling (xhigh)Thinking Machines | 23.75% | 原始记录 |
| MiMo-V2.5-ProXiaomi | 20% | 原始记录 |
| DeepSeek V4 Pro 0424 (DeepSeek V4 Pro (Reasoning, Max Effort))DeepSeek | 18.75% | 原始记录 |
GDP.pdf / All-pass15 项成绩
专业文档推理
- GPT-6 Astra33.2%
- GPT-5.6 Sol28.2%
- Claude Fable 5.128%
- Muse Spark 1.325.6%
- GPT-5.6 Terra25.6%
- Claude Fable 524%
- GPT-5.6 Luna23.8%
- Gemini 3.7 Flash23.6%
- Gemini 3.8 Flash22.8%
- Qwen3.8 Max21.8%
- Claude Opus 521.6%
- GPT-5.5 Instant (June 2026)20.2%
- Kimi K319.6%
- Grok 4.518.8%
- Grok 4.618.8%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| GPT-6 Astra (max)OpenAI | 33.2% | 原始记录 |
| GPT-5.6 Sol (max)OpenAI | 28.2% | 原始记录 |
| Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)Anthropic | 28% | 原始记录 |
| Muse Spark 1.3 (max)Meta | 25.6% | 原始记录 |
| GPT-5.6 Terra (max)OpenAI | 25.6% | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 24% | 原始记录 |
| GPT-5.6 Luna (xhigh)OpenAI | 23.8% | 原始记录 |
| Gemini 3.7 Flash (high)Google | 23.6% | 原始记录 |
| Gemini 3.8 Flash (medium)Google | 22.8% | 原始记录 |
| Qwen3.8 MaxAlibaba | 21.8% | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 21.6% | 原始记录 |
| GPT-5.5 Instant (June 2026)OpenAI | 20.2% | 原始记录 |
| Kimi K3 (max)Kimi | 19.6% | 原始记录 |
| Grok 4.5 (high)SpaceXAI | 18.8% | 原始记录 |
| Grok 4.6 (high)SpaceXAI | 18.8% | 原始记录 |
AutomationBench-AA15 项成绩
业务应用目标完成
- Gemini 3.7 Flash62.75%
- Kimi K352.71%
- Grok 4.551.44%
- GPT-5.6 Sol51.19%
- Gemini 3.6 Flash51.08%
- Gemini 3.8 Flash50.72%
- Claude Fable 548.58%
- GPT-5.6 Terra45.61%
- GPT-5.6 Luna42.24%
- Claude Sonnet 539.19%
- Gemini 3.1 Pro Preview37.54%
- Gemini 3.5 Flash-Lite32.66%
- GLM-5.227.84%
- Kimi K2.7 Code22.53%
- Qwen3.7 Plus20.43%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Gemini 3.7 Flash (high)Google | 62.75% | 原始记录 |
| Kimi K3 (max)Kimi | 52.71% | 原始记录 |
| Grok 4.5 (high)SpaceXAI | 51.44% | 原始记录 |
| GPT-5.6 Sol (max)OpenAI | 51.19% | 原始记录 |
| Gemini 3.6 Flash (high)Google | 51.08% | 原始记录 |
| Gemini 3.8 Flash (high)Google | 50.72% | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 48.58% | 原始记录 |
| GPT-5.6 Terra (max)OpenAI | 45.61% | 原始记录 |
| GPT-5.6 Luna (max)OpenAI | 42.24% | 原始记录 |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 39.19% | 原始记录 |
| Gemini 3.1 Pro PreviewGoogle | 37.54% | 原始记录 |
| Gemini 3.5 Flash-LiteGoogle | 32.66% | 原始记录 |
| GLM-5.2 (max)Z AI | 27.84% | 原始记录 |
| Kimi K2.7 CodeKimi | 22.53% | 原始记录 |
| Qwen3.7 PlusAlibaba | 20.43% | 原始记录 |
EnterpriseOps-Gym-AA15 项成绩
企业运营任务
- Claude Fable 551.12%
- Gemini 3.7 Flash50.4%
- DeepSeek V4 Pro 081349.6%
- Grok 4.648.34%
- Claude Opus 547.48%
- Qwen3.8 2.4T A95B47.36%
- Muse Spark 1.247.27%
- DeepSeek V4 Flash 073147.09%
- Kimi K345.33%
- Claude Sonnet 544.67%
- Qwen3.8 27B44.23%
- GPT-5.6 Sol42.91%
- GLM-5.242.73%
- Inkling Small42.7%
- Gemini 3.5 Flash-Lite42.35%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 51.12% | 原始记录 |
| Gemini 3.7 Flash (medium)Google | 50.4% | 原始记录 |
| DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek | 49.6% | 原始记录 |
| Grok 4.6 (high)SpaceXAI | 48.34% | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 47.48% | 原始记录 |
| Qwen3.8 2.4T A95BAlibaba | 47.36% | 原始记录 |
| Muse Spark 1.2 (xhigh)Meta | 47.27% | 原始记录 |
| DeepSeek V4 Flash 0731 (DeepSeek V4 Flash Vision (Reasoning, Max Effort))DeepSeek | 47.09% | 原始记录 |
| Kimi K3 (max)Kimi | 45.33% | 原始记录 |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 44.67% | 原始记录 |
| Qwen3.8 27B (xhigh)Alibaba | 44.23% | 原始记录 |
| GPT-5.6 Sol (max)OpenAI | 42.91% | 原始记录 |
| GLM-5.2 (max)Z AI | 42.73% | 原始记录 |
| Inkling SmallThinking Machines | 42.7% | 原始记录 |
| Gemini 3.5 Flash-LiteGoogle | 42.35% | 原始记录 |
Harvey LAB-AA15 项成绩
法律任务标准满足率
- Muse Spark 1.395.48%
- Kimi K394.64%
- Claude Fable 593.56%
- Claude Opus 593.46%
- Claude Fable 5.193.27%
- Grok 4.592.42%
- GLM-5.290.97%
- Gemini 3.7 Flash90.66%
- Claude Sonnet 590.07%
- MiniMax-M388.41%
- GPT-5.6 Luna87.9%
- GPT-5.6 Sol87.18%
- GPT-5.6 Terra85.18%
- Gemini 3.6 Flash85.15%
- Kimi K2.7 Code85.02%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Muse Spark 1.3 (xhigh)Meta | 95.48% | 原始记录 |
| Kimi K3 (max)Kimi | 94.64% | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 93.56% | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 93.46% | 原始记录 |
| Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropic | 93.27% | 原始记录 |
| Grok 4.5 (high)SpaceXAI | 92.42% | 原始记录 |
| GLM-5.2 (max)Z AI | 90.97% | 原始记录 |
| Gemini 3.7 Flash (high)Google | 90.66% | 原始记录 |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 90.07% | 原始记录 |
| MiniMax-M3MiniMax | 88.41% | 原始记录 |
| GPT-5.6 Luna (max)OpenAI | 87.9% | 原始记录 |
| GPT-5.6 Sol (max)OpenAI | 87.18% | 原始记录 |
| GPT-5.6 Terra (max)OpenAI | 85.18% | 原始记录 |
| Gemini 3.6 Flash (high)Google | 85.15% | 原始记录 |
| Kimi K2.7 CodeKimi | 85.02% | 原始记录 |
APEX-Agents-AA14 项成绩
跨应用长期任务
- Kimi K341.3%
- GPT-5.6 Terra38.94%
- GPT-5.6 Luna35.84%
- GLM-5.233.7%
- Gemini 3.1 Pro Preview32.01%
- Apodex 1.131.19%
- DeepSeek V4 Pro 042424.26%
- Qwen3.7 Plus22.42%
- Qwen3.5 397B A17B15.34%
- Step 3.7 Flash14.82%
- gpt-oss-120b3.1%
- MiMo-V2.5-Pro2.43%
- Nemotron 3 Super 120B A12B1.84%
- gpt-oss-20b0.74%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Kimi K3 (max)Kimi | 41.3% | 原始记录 |
| GPT-5.6 Terra (max)OpenAI | 38.94% | 原始记录 |
| GPT-5.6 Luna (max)OpenAI | 35.84% | 原始记录 |
| GLM-5.2 (max)Z AI | 33.7% | 原始记录 |
| Gemini 3.1 Pro PreviewGoogle | 32.01% | 原始记录 |
| Apodex 1.1Apodex | 31.19% | 原始记录 |
| DeepSeek V4 Pro 0424 (DeepSeek V4 Pro (Reasoning, Max Effort))DeepSeek | 24.26% | 原始记录 |
| Qwen3.7 PlusAlibaba | 22.42% | 原始记录 |
| Qwen3.5 397B A17B (Reasoning)Alibaba | 15.34% | 原始记录 |
| Step 3.7 FlashStepFun | 14.82% | 原始记录 |
| gpt-oss-120b (high)OpenAI | 3.1% | 原始记录 |
| MiMo-V2.5-ProXiaomi | 2.43% | 原始记录 |
| Nemotron 3 Super 120B A12B (Reasoning)NVIDIA | 1.84% | 原始记录 |
| gpt-oss-20b (high)OpenAI | 0.74% | 原始记录 |
系统研究
GDPval Gold3 项成绩
AI 能否交付专业人员认可的成果? 相对专家成果的胜出与持平比例 (%)
- Claude Opus 4.147.6%
- GPT-5 (high)38.8%
- o3 (high)34.1%
BrowseComp / Parallel study3 项成绩
智能体能否找到难以检索的信息并连接证据? 正确率 (%)
Terminal-Bench 2.02 项成绩
改变执行机制能让结果发生多大变化? 任务成功率 (%)
智能体与工具
τ³-Banking15 项成绩
银行政策检索与工具执行
- Muse Spark 1.352.37%
- Qwen3.8 Max51.34%
- Grok 4.650.72%
- GLM-5.350.31%
- Qwen3.8 2.4T A95B49.07%
- Qwen3.8 27B48.04%
- GLM 5.3 Flash47.22%
- Claude Fable 5.147.22%
- Kimi K345.98%
- Gemini 3.8 Flash45.77%
- Qwen3.8-Flash-Next45.36%
- Claude Opus 544.74%
- GPT-5.6 Sol44.33%
- GPT-6 Astra43.09%
- Grok 4.542.06%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Muse Spark 1.3 (max)Meta | 52.37% | 原始记录 |
| Qwen3.8 MaxAlibaba | 51.34% | 原始记录 |
| Grok 4.6 (high)SpaceXAI | 50.72% | 原始记录 |
| GLM-5.3 (max)Z AI | 50.31% | 原始记录 |
| Qwen3.8 2.4T A95BAlibaba | 49.07% | 原始记录 |
| Qwen3.8 27B (xhigh)Alibaba | 48.04% | 原始记录 |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 47.22% | 原始记录 |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 47.22% | 原始记录 |
| Kimi K3 (max)Kimi | 45.98% | 原始记录 |
| Gemini 3.8 Flash (medium)Google | 45.77% | 原始记录 |
| Qwen3.8-Flash-NextAlibaba | 45.36% | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic | 44.74% | 原始记录 |
| GPT-5.6 Sol (max)OpenAI | 44.33% | 原始记录 |
| GPT-6 Astra (xhigh)OpenAI | 43.09% | 原始记录 |
| Grok 4.5 (high)SpaceXAI | 42.06% | 原始记录 |
τ²-Bench15 项成绩
对话工具使用
- JT-35B-Flash99.12%
- GLM-5.299.12%
- Step 3.7 Flash98.54%
- Claude Fable 598.54%
- DeepSeek V4 Pro 042496.2%
- Qwen3.5 397B A17B95.61%
- Gemini 3.5 Flash95.61%
- Gemini 3.1 Pro Preview95.61%
- Qwen3.6 35B A3B95.32%
- DeepSeek V4 Flash 042094.44%
- MiMo-V2.5-Pro94.15%
- Qwen3.6 27B94.15%
- Mistral Medium 3.594.15%
- Qwen3.5 122B A10B93.57%
- MiMo-V2-Flash (Feb 2026)93.27%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| JT-35B-FlashChina Mobile | 99.12% | 原始记录 |
| GLM-5.2 (max)Z AI | 99.12% | 原始记录 |
| Step 3.7 FlashStepFun | 98.54% | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 98.54% | 原始记录 |
| DeepSeek V4 Pro 0424 (DeepSeek V4 Pro (Reasoning, Max Effort))DeepSeek | 96.2% | 原始记录 |
| Qwen3.5 397B A17B (Reasoning)Alibaba | 95.61% | 原始记录 |
| Gemini 3.5 Flash (medium)Google | 95.61% | 原始记录 |
| Gemini 3.1 Pro PreviewGoogle | 95.61% | 原始记录 |
| Qwen3.6 35B A3B (Reasoning)Alibaba | 95.32% | 原始记录 |
| DeepSeek V4 Flash 0420 (DeepSeek V4 Flash (Non-reasoning))DeepSeek | 94.44% | 原始记录 |
| MiMo-V2.5-ProXiaomi | 94.15% | 原始记录 |
| Qwen3.6 27B (Reasoning)Alibaba | 94.15% | 原始记录 |
| Mistral Medium 3.5Mistral | 94.15% | 原始记录 |
| Qwen3.5 122B A10B (Reasoning)Alibaba | 93.57% | 原始记录 |
| MiMo-V2-Flash (Feb 2026)Xiaomi | 93.27% | 原始记录 |
ITBench-AA15 项成绩
运维故障根因分析
- GPT-5.6 Sol56.21%
- GPT-5.6 Terra51.04%
- Kimi K347.69%
- GLM-5.242.66%
- GPT-5.6 Luna40.32%
- DeepSeek V4 Pro 042438.32%
- MiMo-V2.5-Pro38.23%
- Gemma 4 31B37.29%
- Qwen3.5 397B A17B34.09%
- Gemini 3.1 Pro Preview30.33%
- Step 3.7 Flash30.27%
- Claude 4.5 Haiku27.31%
- Gemma 4 26B A4B23.63%
- gpt-oss-120b5.65%
- Nemotron 3 Super 120B A12B1.13%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| GPT-5.6 Sol (max)OpenAI | 56.21% | 原始记录 |
| GPT-5.6 Terra (max)OpenAI | 51.04% | 原始记录 |
| Kimi K3 (max)Kimi | 47.69% | 原始记录 |
| GLM-5.2 (max)Z AI | 42.66% | 原始记录 |
| GPT-5.6 Luna (max)OpenAI | 40.32% | 原始记录 |
| DeepSeek V4 Pro 0424 (DeepSeek V4 Pro (Reasoning, Max Effort))DeepSeek | 38.32% | 原始记录 |
| MiMo-V2.5-ProXiaomi | 38.23% | 原始记录 |
| Gemma 4 31B (Reasoning)Google | 37.29% | 原始记录 |
| Qwen3.5 397B A17B (Reasoning)Alibaba | 34.09% | 原始记录 |
| Gemini 3.1 Pro PreviewGoogle | 30.33% | 原始记录 |
| Step 3.7 FlashStepFun | 30.27% | 原始记录 |
| Claude 4.5 Haiku (Reasoning)Anthropic | 27.31% | 原始记录 |
| Gemma 4 26B A4B (Reasoning)Google | 23.63% | 原始记录 |
| gpt-oss-120b (high)OpenAI | 5.65% | 原始记录 |
| Nemotron 3 Super 120B A12B (Reasoning)NVIDIA | 1.13% | 原始记录 |
MCP-Atlas public set / Z.ai report7 项成绩
使用连接工具完成任务。
- GPT-5.268%
- GLM-567.8%
- Gemini 3 Pro66.6%
- Claude Opus 4.565.2%
- Kimi K2.563.8%
- DeepSeek V3.262.2%
- GLM-4.752%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| GPT-5.2 (xhigh)OpenAI | 68% | 原始记录 |
| GLM-5 release reportZ.ai | 67.8% | 原始记录 |
| Gemini 3 Pro (GLM-5 release comparison)Google | 66.6% | 原始记录 |
| Claude Opus 4.5 (GLM-5 release comparison)Anthropic | 65.2% | 原始记录 |
| Kimi K2.5 (GLM-5 release comparison)Moonshot AI | 63.8% | 原始记录 |
| DeepSeek V3.2 (GLM-5 release comparison)DeepSeek | 62.2% | 原始记录 |
| GLM-4.7 (GLM-5 release comparison)Z.ai | 52% | 原始记录 |
代码与执行
Terminal-Bench v2.115 项成绩
终端任务完成
- Claude Fable 5.191.39%
- GPT-6 Astra89.89%
- GPT-5.6 Sol89.51%
- Claude Opus 589.14%
- Grok 4.688.39%
- GPT-5.6 Terra88.01%
- Gemini 3.8 Flash87.64%
- Qwen3.8-Flash-Next86.14%
- Muse Spark 1.385.77%
- Gemini 3.7 Flash85.77%
- Kimi K385.02%
- Claude Fable 584.64%
- GLM 5.3 Flash84.27%
- GLM-5.383.9%
- Qwen3.8 2.4T A95B82.02%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 91.39% | 原始记录 |
| GPT-6 Astra (high)OpenAI | 89.89% | 原始记录 |
| GPT-5.6 Sol (xhigh)OpenAI | 89.51% | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 89.14% | 原始记录 |
| Grok 4.6 (high)SpaceXAI | 88.39% | 原始记录 |
| GPT-5.6 Terra (max)OpenAI | 88.01% | 原始记录 |
| Gemini 3.8 Flash (high)Google | 87.64% | 原始记录 |
| Qwen3.8-Flash-NextAlibaba | 86.14% | 原始记录 |
| Muse Spark 1.3 (max)Meta | 85.77% | 原始记录 |
| Gemini 3.7 Flash (high)Google | 85.77% | 原始记录 |
| Kimi K3 (max)Kimi | 85.02% | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 84.64% | 原始记录 |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 84.27% | 原始记录 |
| GLM-5.3 (max)Z AI | 83.9% | 原始记录 |
| Qwen3.8 2.4T A95BAlibaba | 82.02% | 原始记录 |
SciCode15 项成绩
科学编程
- Claude Fable 5.163.08%
- Claude Fable 561%
- Gemini 3.7 Flash59.84%
- Muse Spark 1.359.72%
- Kimi K359.49%
- GLM-5.359.03%
- Gemini 3.1 Pro Preview58.68%
- GPT-5.6 Sol57.75%
- Muse Spark 1.257.41%
- Gemini 3.8 Flash56.6%
- GPT-6 Astra56.48%
- Grok 4.656.48%
- Claude Opus 556.37%
- Grok 4.554.98%
- GPT-5.6 Terra54.98%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 63.08% | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 61% | 原始记录 |
| Gemini 3.7 Flash (medium)Google | 59.84% | 原始记录 |
| Muse Spark 1.3 (xhigh)Meta | 59.72% | 原始记录 |
| Kimi K3 (max)Kimi | 59.49% | 原始记录 |
| GLM-5.3 (max)Z AI | 59.03% | 原始记录 |
| Gemini 3.1 Pro PreviewGoogle | 58.68% | 原始记录 |
| GPT-5.6 Sol (high)OpenAI | 57.75% | 原始记录 |
| Muse Spark 1.2 (xhigh)Meta | 57.41% | 原始记录 |
| Gemini 3.8 Flash (high)Google | 56.6% | 原始记录 |
| GPT-6 Astra (max)OpenAI | 56.48% | 原始记录 |
| Grok 4.6 (high)SpaceXAI | 56.48% | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 56.37% | 原始记录 |
| Grok 4.5 (high)SpaceXAI | 54.98% | 原始记录 |
| GPT-5.6 Terra (max)OpenAI | 54.98% | 原始记录 |
LiveCodeBench15 项成绩
编程问题求解
- gpt-oss-120b87.83%
- ERNIE 5.0 Thinking Preview81.16%
- o380.85%
- Apriel-v1.6-15B-Thinker80.74%
- Qwen3 Next 80B A3B (Reasoning)78.41%
- INTELLECT-377.67%
- gpt-oss-20b77.67%
- K-EXAONE76.83%
- Doubao Seed Code76.61%
- Magistral Medium 1.275.03%
- EXAONE 4.0 32B74.71%
- NVIDIA Nemotron 3 Nano 30B A3B74.07%
- Llama Nemotron Super 49B v1.573.65%
- Nova 2.0 Pro Preview73.02%
- Falcon-H1R-7B72.38%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| gpt-oss-120b (high)OpenAI | 87.83% | 原始记录 |
| ERNIE 5.0 Thinking PreviewBaidu | 81.16% | 原始记录 |
| o3OpenAI | 80.85% | 原始记录 |
| Apriel-v1.6-15B-ThinkerServiceNow | 80.74% | 原始记录 |
| Qwen3 Next 80B A3B (Reasoning)Alibaba | 78.41% | 原始记录 |
| INTELLECT-3Prime Intellect | 77.67% | 原始记录 |
| gpt-oss-20b (high)OpenAI | 77.67% | 原始记录 |
| K-EXAONE (Reasoning)LG AI Research | 76.83% | 原始记录 |
| Doubao Seed CodeByteDance Seed | 76.61% | 原始记录 |
| Magistral Medium 1.2Mistral | 75.03% | 原始记录 |
| EXAONE 4.0 32B (Reasoning)LG AI Research | 74.71% | 原始记录 |
| NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)NVIDIA | 74.07% | 原始记录 |
| Llama Nemotron Super 49B v1.5 (Reasoning)NVIDIA | 73.65% | 原始记录 |
| Nova 2.0 Pro Preview (medium)Amazon | 73.02% | 原始记录 |
| Falcon-H1R-7BTII UAE | 72.38% | 原始记录 |
SciCode / MiniMax report7 项成绩
科学编程任务。
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Gemini 3 Pro (MiniMax internal evaluation)Google | 56 | 原始记录 |
| Claude Opus 4.6 (MiniMax internal evaluation)Anthropic | 52 | 原始记录 |
| GPT-5.2 (Thinking; MiniMax internal evaluation)OpenAI | 52 | 原始记录 |
| Claude Opus 4.5 (MiniMax internal evaluation)Anthropic | 50 | 原始记录 |
| Claude Sonnet 4.5 (MiniMax internal evaluation)Anthropic | 45 | 原始记录 |
| MiniMax-M2.5 (MiniMax internal evaluation)MiniMax | 44.4 | 原始记录 |
| MiniMax-M2.1 (MiniMax internal evaluation)MiniMax | 41 | 原始记录 |
Terminal Bench 2.1 / DeepSeek GA report8 项成绩
终端中的编程与工具使用任务。
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Kimi K3 (Code-agent evaluation; harness and reasoning effort not disclosed for this model)Moonshot AI | 88.3 | 原始记录 |
| Fable-5 (w/ fallback) (Code-agent evaluation; harness and reasoning effort not disclosed for this model; with fallback, details unspecified)Anthropic | 88 | 原始记录 |
| DeepSeek-V4-Pro-0813 (DeepSeek Harness minimal; max reasoning effort; temperature=1.0; top_p=0.95)DeepSeek | 87.9 | 原始记录 |
| Opus-4.8 (Code-agent evaluation; harness and reasoning effort not disclosed for this model)Anthropic | 85 | 原始记录 |
| DeepSeek-V4-Flash-0731 (Code-agent evaluation; harness and reasoning effort not disclosed for this model)DeepSeek | 82.7 | 原始记录 |
| GLM-5.2 (Code-agent evaluation; harness and reasoning effort not disclosed for this model)Z.ai | 81 | 原始记录 |
| DeepSeek-V4-Pro (Preview) (Code-agent evaluation; harness and reasoning effort not disclosed for this model)DeepSeek | 72.1 | 原始记录 |
| DeepSeek-V4-Flash (Preview) (Code-agent evaluation; harness and reasoning effort not disclosed for this model)DeepSeek | 61.8 | 原始记录 |
SWE-bench Pro refined set / Qwen3.8-Max report5 项成绩
Qwen修订的SWE-bench Pro评测集上的代码修复任务。
- Fable 580
- Opus 4.869.2
- Qwen3.8-Max67.7
- GPT 5.6 Sol (max)64.6
- Qwen3.7-Max60.6
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Fable 5 (Qwen-refined set; Claude Code; temperature=1.0; top_p=0.95; 256K context; may involve fallback; reasoning effort not disclosed)Anthropic | 80 | 原始记录 |
| Opus 4.8 (Qwen-refined set; Claude Code; temperature=1.0; top_p=0.95; 256K context; reasoning effort not disclosed)Anthropic | 69.2 | 原始记录 |
| Qwen3.8-Max service model; Qwen-refined set; Claude Code; temperature=1.0; top_p=0.95; 256K context; reasoning effort not disclosedQwen | 67.7 | 原始记录 |
| GPT 5.6 Sol (max) (Qwen-refined set; Claude Code; max (table header); temperature=1.0; top_p=0.95; 256K context)OpenAI | 64.6 | 原始记录 |
| Qwen3.7-Max (Qwen-refined set; Claude Code; temperature=1.0; top_p=0.95; 256K context; reasoning effort not disclosed)Qwen | 60.6 | 原始记录 |
SWE-bench Verified / Google G31 (2026-02-19)5 项成绩
模型及其编程代理环境解决代码仓库问题的比例。
- Claude Opus 4.680.8%
- Gemini 3.1 Pro80.6%
- GPT-5.280%
- Claude Sonnet 4.679.6%
- Gemini 3 Pro76.2%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Claude Opus 4.6 (Thinking (Max); Single attempt; provider-specific scaffolding)Anthropic | 80.8% | 原始记录 |
| Gemini 3.1 Pro (Thinking (High); Single attempt; provider-specific scaffolding)Google | 80.6% | 原始记录 |
| GPT-5.2 (Thinking (xhigh); Single attempt; provider-specific scaffolding)OpenAI | 80% | 原始记录 |
| Claude Sonnet 4.6 (Thinking (Max); Single attempt; provider-specific scaffolding)Anthropic | 79.6% | 原始记录 |
| Gemini 3 Pro (Thinking (High); Single attempt; provider-specific scaffolding)Google | 76.2% | 原始记录 |
SWE-bench Pro (Public) / Google G31 (2026-02-19)4 项成绩
SWE-bench Pro 公开版软件工程任务。
- GPT-5.3-Codex56.8%
- GPT-5.255.6%
- Gemini 3.1 Pro54.2%
- Gemini 3 Pro43.3%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| GPT-5.3-Codex (Thinking (xhigh); Public split; single attempt; provider-specific scaffolding)OpenAI | 56.8% | 原始记录 |
| GPT-5.2 (Thinking (xhigh); Public split; single attempt; provider-specific scaffolding)OpenAI | 55.6% | 原始记录 |
| Gemini 3.1 Pro (Thinking (High); Public split; single attempt; provider-specific scaffolding)Google | 54.2% | 原始记录 |
| Gemini 3 Pro (Thinking (High); Public split; single attempt; provider-specific scaffolding)Google | 43.3% | 原始记录 |
模型推理
Intelligence Index v4.215 项成绩
10项评测综合指数
- Claude Fable 5.156.76
- GPT-6 Astra54.66
- Claude Opus 554.05
- Claude Fable 553.19
- Muse Spark 1.352.95
- GPT-5.6 Sol51.26
- Grok 4.650.58
- Kimi K350.23
- GLM-5.348.58
- Gemini 3.8 Flash47.07
- Qwen3.8 Max46.91
- Muse Spark 1.246.84
- GPT-5.6 Terra46.77
- Qwen3.8 2.4T A95B46.74
- GLM 5.3 Flash46.22
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 56.76 | 原始记录 |
| GPT-6 Astra (max)OpenAI | 54.66 | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 54.05 | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 53.19 | 原始记录 |
| Muse Spark 1.3 (max)Meta | 52.95 | 原始记录 |
| GPT-5.6 Sol (max)OpenAI | 51.26 | 原始记录 |
| Grok 4.6 (high)SpaceXAI | 50.58 | 原始记录 |
| Kimi K3 (max)Kimi | 50.23 | 原始记录 |
| GLM-5.3 (max)Z AI | 48.58 | 原始记录 |
| Gemini 3.8 Flash (high)Google | 47.07 | 原始记录 |
| Qwen3.8 MaxAlibaba | 46.91 | 原始记录 |
| Muse Spark 1.2 (xhigh)Meta | 46.84 | 原始记录 |
| GPT-5.6 Terra (max)OpenAI | 46.77 | 原始记录 |
| Qwen3.8 2.4T A95BAlibaba | 46.74 | 原始记录 |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 46.22 | 原始记录 |
Humanity's Last Exam15 项成绩
专家知识与复杂推理
- Claude Fable 5.159.13%
- Claude Fable 555.47%
- Claude Opus 554.87%
- GPT-6 Astra54.68%
- GPT-5.6 Sol49.49%
- Muse Spark 1.349.07%
- Gemini 3.7 Flash47.87%
- Gemini 3.8 Flash47.82%
- Gemini 3.1 Pro Preview47.03%
- Kimi K346.9%
- Muse Spark 1.245.46%
- Grok 4.644.07%
- Qwen3.8 Max43.05%
- GPT-5.6 Terra42.91%
- Grok 4.542.68%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 59.13% | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 55.47% | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 54.87% | 原始记录 |
| GPT-6 Astra (max)OpenAI | 54.68% | 原始记录 |
| GPT-5.6 Sol (max)OpenAI | 49.49% | 原始记录 |
| Muse Spark 1.3 (max)Meta | 49.07% | 原始记录 |
| Gemini 3.7 Flash (high)Google | 47.87% | 原始记录 |
| Gemini 3.8 Flash (high)Google | 47.82% | 原始记录 |
| Gemini 3.1 Pro PreviewGoogle | 47.03% | 原始记录 |
| Kimi K3 (max)Kimi | 46.9% | 原始记录 |
| Muse Spark 1.2 (xhigh)Meta | 45.46% | 原始记录 |
| Grok 4.6 (xhigh)SpaceXAI | 44.07% | 原始记录 |
| Qwen3.8 MaxAlibaba | 43.05% | 原始记录 |
| GPT-5.6 Terra (max)OpenAI | 42.91% | 原始记录 |
| Grok 4.5 (high)SpaceXAI | 42.68% | 原始记录 |
GPQA Diamond15 项成绩
研究生级科学推理
- GPT-6 Astra96.26%
- Gemini 3.8 Flash95.25%
- Grok 4.694.95%
- Gemini 3.7 Flash94.55%
- Gemini 3.1 Pro Preview94.14%
- Muse Spark 1.394.14%
- GPT-5.6 Sol94.14%
- Claude Opus 593.74%
- Claude Fable 5.193.74%
- Qwen3.8 2.4T A95B93.54%
- Kimi K393.54%
- Grok 4.593.13%
- MiniMax-M392.93%
- Gemini 3.6 Flash92.83%
- DeepSeek V4 Pro 081392.83%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| GPT-6 Astra (xhigh)OpenAI | 96.26% | 原始记录 |
| Gemini 3.8 Flash (high)Google | 95.25% | 原始记录 |
| Grok 4.6 (high)SpaceXAI | 94.95% | 原始记录 |
| Gemini 3.7 Flash (high)Google | 94.55% | 原始记录 |
| Gemini 3.1 Pro PreviewGoogle | 94.14% | 原始记录 |
| Muse Spark 1.3 (xhigh)Meta | 94.14% | 原始记录 |
| GPT-5.6 Sol (max)OpenAI | 94.14% | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic | 93.74% | 原始记录 |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 93.74% | 原始记录 |
| Qwen3.8 2.4T A95BAlibaba | 93.54% | 原始记录 |
| Kimi K3 (max)Kimi | 93.54% | 原始记录 |
| Grok 4.5 (high)SpaceXAI | 93.13% | 原始记录 |
| MiniMax-M3MiniMax | 92.93% | 原始记录 |
| Gemini 3.6 Flash (high)Google | 92.83% | 原始记录 |
| DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek | 92.83% | 原始记录 |
CritPt15 项成绩
研究级物理问题
- GPT-5.6 Sol32.29%
- GPT-6 Astra31.71%
- Claude Fable 5.131.14%
- GPT-5.5 Pro30.57%
- GPT-5.6 Terra30%
- Claude Opus 529.14%
- Claude Fable 528.57%
- Muse Spark 1.326%
- Gemini 3 Deep Think25.71%
- Kimi K323.43%
- GLM-5.220.86%
- GPT-5.6 Luna20.57%
- Qwen3.8 Max20%
- Qwen3.8 2.4T A95B20%
- Grok 4.619.71%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| GPT-5.6 Sol (max)OpenAI | 32.29% | 原始记录 |
| GPT-6 Astra (max)OpenAI | 31.71% | 原始记录 |
| Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropic | 31.14% | 原始记录 |
| GPT-5.5 Pro (xhigh)OpenAI | 30.57% | 原始记录 |
| GPT-5.6 Terra (max)OpenAI | 30% | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 29.14% | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 28.57% | 原始记录 |
| Muse Spark 1.3 (xhigh)Meta | 26% | 原始记录 |
| Gemini 3 Deep ThinkGoogle | 25.71% | 原始记录 |
| Kimi K3 (max)Kimi | 23.43% | 原始记录 |
| GLM-5.2 (max)Z AI | 20.86% | 原始记录 |
| GPT-5.6 Luna (max)OpenAI | 20.57% | 原始记录 |
| Qwen3.8 MaxAlibaba | 20% | 原始记录 |
| Qwen3.8 2.4T A95BAlibaba | 20% | 原始记录 |
| Grok 4.6 (xhigh)SpaceXAI | 19.71% | 原始记录 |
AIME 202515 项成绩
竞赛数学
- Nova 2.0 Lite94.33%
- gpt-oss-120b93.44%
- NVIDIA Nemotron 3 Nano 30B A3B91%
- K-EXAONE90.33%
- Nova 2.0 Omni89.67%
- gpt-oss-20b89.33%
- Nova 2.0 Pro Preview89%
- o388.33%
- INTELLECT-388%
- Apriel-v1.6-15B-Thinker88%
- ERNIE 5.0 Thinking Preview85%
- Qwen3 Next 80B A3B (Reasoning)84.33%
- Ring-flash-2.083.67%
- Claude 4.5 Haiku83.67%
- Magistral Medium 1.282%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Nova 2.0 Lite (high)Amazon | 94.33% | 原始记录 |
| gpt-oss-120b (high)OpenAI | 93.44% | 原始记录 |
| NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)NVIDIA | 91% | 原始记录 |
| K-EXAONE (Reasoning)LG AI Research | 90.33% | 原始记录 |
| Nova 2.0 Omni (medium)Amazon | 89.67% | 原始记录 |
| gpt-oss-20b (high)OpenAI | 89.33% | 原始记录 |
| Nova 2.0 Pro Preview (medium)Amazon | 89% | 原始记录 |
| o3OpenAI | 88.33% | 原始记录 |
| INTELLECT-3Prime Intellect | 88% | 原始记录 |
| Apriel-v1.6-15B-ThinkerServiceNow | 88% | 原始记录 |
| ERNIE 5.0 Thinking PreviewBaidu | 85% | 原始记录 |
| Qwen3 Next 80B A3B (Reasoning)Alibaba | 84.33% | 原始记录 |
| Ring-flash-2.0InclusionAI | 83.67% | 原始记录 |
| Claude 4.5 Haiku (Reasoning)Anthropic | 83.67% | 原始记录 |
| Magistral Medium 1.2Mistral | 82% | 原始记录 |
IFBench15 项成绩
复杂指令遵循
- Grok 4.383.33%
- MiniMax-M382.86%
- Nemotron 3 Ultra 550B A55B81.36%
- Nemotron Cascade 2 30B A3B80.41%
- MiMo-V2.5-Pro79.86%
- Nova 2.0 Pro Preview79.59%
- Qwen3.5 397B A17B78.78%
- Qwen3.7 Plus77.96%
- Gemini 3.1 Pro Preview77.14%
- DeepSeek V4 Pro 042476.46%
- Qwen3.5 122B A10B75.71%
- Gemma 4 31B75.58%
- GPT-5.3 Codex75.37%
- Gemini 3.5 Flash74.56%
- Command A+73.95%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Grok 4.3 (medium)SpaceXAI | 83.33% | 原始记录 |
| MiniMax-M3MiniMax | 82.86% | 原始记录 |
| Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA | 81.36% | 原始记录 |
| Nemotron Cascade 2 30B A3BNVIDIA | 80.41% | 原始记录 |
| MiMo-V2.5-ProXiaomi | 79.86% | 原始记录 |
| Nova 2.0 Pro Preview (low)Amazon | 79.59% | 原始记录 |
| Qwen3.5 397B A17B (Reasoning)Alibaba | 78.78% | 原始记录 |
| Qwen3.7 PlusAlibaba | 77.96% | 原始记录 |
| Gemini 3.1 Pro PreviewGoogle | 77.14% | 原始记录 |
| DeepSeek V4 Pro 0424 (DeepSeek V4 Pro (Reasoning, Max Effort))DeepSeek | 76.46% | 原始记录 |
| Qwen3.5 122B A10B (Reasoning)Alibaba | 75.71% | 原始记录 |
| Gemma 4 31B (Reasoning)Google | 75.58% | 原始记录 |
| GPT-5.3 Codex (xhigh)OpenAI | 75.37% | 原始记录 |
| Gemini 3.5 Flash (medium)Google | 74.56% | 原始记录 |
| Command A+Cohere | 73.95% | 原始记录 |
LongBench v2 / Moonshot report5 项成绩
长输入阅读与推理。
- Gemini 3 Pro68.2
- Claude Opus 4.564.4
- Kimi K2.561
- DeepSeek V3.259.8
- GPT-5.254.5
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Gemini 3 Pro (High Thinking Level; publisher rerun (*))Google | 68.2 | 原始记录 |
| Claude Opus 4.5 (Extended Thinking; publisher rerun (*))Anthropic | 64.4 | 原始记录 |
| Kimi K2.5 (Thinking)Moonshot AI | 61 | 原始记录 |
| DeepSeek V3.2 (Thinking; publisher rerun (*))DeepSeek | 59.8 | 原始记录 |
| GPT-5.2 (xhigh; publisher rerun (*))OpenAI | 54.5 | 原始记录 |
AIME 2026 I / Z.ai report6 项成绩
2026 年 AIME 第一场,不是全年合并题集。
- Claude Opus 4.593.3
- GLM-4.792.9
- GLM-592.7
- DeepSeek V3.292.7
- Kimi K2.592.5
- Gemini 3 Pro90.6
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Claude Opus 4.5 (GLM-5 release comparison)Anthropic | 93.3 | 原始记录 |
| GLM-4.7 (GLM-5 release comparison)Z.ai | 92.9 | 原始记录 |
| GLM-5 release reportZ.ai | 92.7 | 原始记录 |
| DeepSeek V3.2 (GLM-5 release comparison)DeepSeek | 92.7 | 原始记录 |
| Kimi K2.5 (GLM-5 release comparison)Moonshot AI | 92.5 | 原始记录 |
| Gemini 3 Pro (GLM-5 release comparison)Google | 90.6 | 原始记录 |
HMMT November 2025 / Z.ai report7 项成绩
2025 年 11 月数学竞赛题。
- GPT-5.297.1
- GLM-596.9
- GLM-4.793.5
- Gemini 3 Pro93
- Claude Opus 4.591.7
- Kimi K2.591.1
- DeepSeek V3.290.2
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| GPT-5.2 (xhigh)OpenAI | 97.1 | 原始记录 |
| GLM-5 release reportZ.ai | 96.9 | 原始记录 |
| GLM-4.7 (GLM-5 release comparison)Z.ai | 93.5 | 原始记录 |
| Gemini 3 Pro (GLM-5 release comparison)Google | 93 | 原始记录 |
| Claude Opus 4.5 (GLM-5 release comparison)Anthropic | 91.7 | 原始记录 |
| Kimi K2.5 (GLM-5 release comparison)Moonshot AI | 91.1 | 原始记录 |
| DeepSeek V3.2 (GLM-5 release comparison)DeepSeek | 90.2 | 原始记录 |
AA-LCR / MiniMax report7 项成绩
基于长输入的推理。
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Claude Opus 4.5 (MiniMax internal evaluation)Anthropic | 74 | 原始记录 |
| GPT-5.2 (Thinking; MiniMax internal evaluation)OpenAI | 73 | 原始记录 |
| Claude Opus 4.6 (MiniMax internal evaluation)Anthropic | 71 | 原始记录 |
| Gemini 3 Pro (MiniMax internal evaluation)Google | 71 | 原始记录 |
| MiniMax-M2.5 (MiniMax internal evaluation)MiniMax | 69.5 | 原始记录 |
| Claude Sonnet 4.5 (MiniMax internal evaluation)Anthropic | 66 | 原始记录 |
| MiniMax-M2.1 (MiniMax internal evaluation)MiniMax | 62 | 原始记录 |
HLE no tools / DeepSeek GA report8 项成绩
不使用工具的跨学科推理评测。
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Fable-5 (w/ fallback) (No tools; HLE reasoning effort and token budget not disclosed; with fallback, details unspecified)Anthropic | 53.3 | 原始记录 |
| Opus-4.8 (No tools; HLE reasoning effort and token budget not disclosed)Anthropic | 49.8 | 原始记录 |
| Kimi K3 (No tools; HLE reasoning effort and token budget not disclosed)Moonshot AI | 43.5 | 原始记录 |
| DeepSeek-V4-Pro-0813 (No tools; HLE reasoning effort and token budget not disclosed)DeepSeek | 42.7 | 原始记录 |
| GLM-5.2 (No tools; HLE reasoning effort and token budget not disclosed)Z.ai | 40.5 | 原始记录 |
| DeepSeek-V4-Flash-0731 (No tools; HLE reasoning effort and token budget not disclosed)DeepSeek | 37.8 | 原始记录 |
| DeepSeek-V4-Pro (Preview) (No tools; HLE reasoning effort and token budget not disclosed)DeepSeek | 37.7 | 原始记录 |
| DeepSeek-V4-Flash (Preview) (No tools; HLE reasoning effort and token budget not disclosed)DeepSeek | 34.8 | 原始记录 |
HLE with tools / DeepSeek GA report8 项成绩
使用工具的跨学科推理评测。
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Fable-5 (w/ fallback) (With tools; specific tools, HLE reasoning effort and token budget not disclosed; with fallback, details unspecified)Anthropic | 63 | 原始记录 |
| DeepSeek-V4-Pro-0813 (With tools; specific tools, HLE reasoning effort and token budget not disclosed)DeepSeek | 60 | 原始记录 |
| Opus-4.8 (With tools; specific tools, HLE reasoning effort and token budget not disclosed)Anthropic | 57.9 | 原始记录 |
| Kimi K3 (With tools; specific tools, HLE reasoning effort and token budget not disclosed)Moonshot AI | 56 | 原始记录 |
| GLM-5.2 (With tools; specific tools, HLE reasoning effort and token budget not disclosed)Z.ai | 54.7 | 原始记录 |
| DeepSeek-V4-Flash-0731 (With tools; specific tools, HLE reasoning effort and token budget not disclosed)DeepSeek | 51.5 | 原始记录 |
| DeepSeek-V4-Pro (Preview) (With tools; specific tools, HLE reasoning effort and token budget not disclosed)DeepSeek | 48.2 | 原始记录 |
| DeepSeek-V4-Flash (Preview) (With tools; specific tools, HLE reasoning effort and token budget not disclosed)DeepSeek | 45.1 | 原始记录 |
HMMT February 2026 / DeepSeek Preview report6 项成绩
以单个答案成功率Pass@1衡量的数学竞赛题。
- GPT-5.4 xHigh97.7%
- Opus-4.6 Max96.2%
- DS-V4-Pro Max95.2%
- Gemini-3.1-Pro High94.7%
- K2.6 Thinking92.7%
- GLM-5.1 Thinking89.4%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| GPT-5.4 xHigh (xHigh; DeepSeek Preview report comparison)OpenAI | 97.7% | 原始记录 |
| Opus-4.6 Max (Max; DeepSeek Preview report comparison)Anthropic | 96.2% | 原始记录 |
| DS-V4-Pro Max (Preview; Max; temperature=1.0; 384K-token context; distinct rigorous-proof math prompt)DeepSeek | 95.2% | 原始记录 |
| Gemini-3.1-Pro High (High; DeepSeek Preview report comparison)Google | 94.7% | 原始记录 |
| K2.6 Thinking (Thinking; DeepSeek Preview report comparison)Moonshot AI | 92.7% | 原始记录 |
| GLM-5.1 Thinking (Thinking; DeepSeek Preview report comparison)Z.ai | 89.4% | 原始记录 |
LongBench v2 / Qwen3.8-Max report4 项成绩
长文档与长输入的阅读和推理。
- Opus 4.869.1
- GPT 5.6 Sol (max)67.1
- Qwen3.8-Max66.3
- Qwen3.7-Max65.3
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Opus 4.8 (LongBench v2; tools, reasoning effort and token budget not disclosed)Anthropic | 69.1 | 原始记录 |
| GPT 5.6 Sol (max) (max (table header); LongBench v2 tools and token budget not disclosed)OpenAI | 67.1 | 原始记录 |
| Qwen3.8-Max service model; LongBench v2 tools, reasoning effort and token budget not disclosedQwen | 66.3 | 原始记录 |
| Qwen3.7-Max (LongBench v2; tools, reasoning effort and token budget not disclosed)Qwen | 65.3 | 原始记录 |
GPQA Diamond / Google G31 (2026-02-19)5 项成绩
不使用工具的科学知识与推理评测。
- Gemini 3.1 Pro94.3%
- GPT-5.292.4%
- Gemini 3 Pro91.9%
- Claude Opus 4.691.3%
- Claude Sonnet 4.689.9%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Gemini 3.1 Pro (Thinking (High); No tools)Google | 94.3% | 原始记录 |
| GPT-5.2 (Thinking (xhigh); No tools)OpenAI | 92.4% | 原始记录 |
| Gemini 3 Pro (Thinking (High); No tools)Google | 91.9% | 原始记录 |
| Claude Opus 4.6 (Thinking (Max); No tools)Anthropic | 91.3% | 原始记录 |
| Claude Sonnet 4.6 (Thinking (Max); No tools)Anthropic | 89.9% | 原始记录 |
HLE, no tools / Google G31 (2026-02-19)5 项成绩
不使用工具完成 HLE 全部文本与多模态题目。
- Gemini 3.1 Pro44.4%
- Claude Opus 4.640%
- Gemini 3 Pro37.5%
- GPT-5.234.5%
- Claude Sonnet 4.633.2%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Gemini 3.1 Pro (Thinking (High); No tools)Google | 44.4% | 原始记录 |
| Claude Opus 4.6 (Thinking (Max); No tools)Anthropic | 40% | 原始记录 |
| Gemini 3 Pro (Thinking (High); No tools)Google | 37.5% | 原始记录 |
| GPT-5.2 (Thinking (xhigh); No tools)OpenAI | 34.5% | 原始记录 |
| Claude Sonnet 4.6 (Thinking (Max); No tools)Anthropic | 33.2% | 原始记录 |
HLE, search and code / Google G31 (2026-02-19)5 项成绩
使用搜索与代码执行的 HLE 推理评测。
- Claude Opus 4.653.1%
- Gemini 3.1 Pro51.4%
- Claude Sonnet 4.649%
- Gemini 3 Pro45.8%
- GPT-5.245.5%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Claude Opus 4.6 (Thinking (Max); Search and code; provider-specific tools)Anthropic | 53.1% | 原始记录 |
| Gemini 3.1 Pro (Thinking (High); Search and code; provider-specific tools)Google | 51.4% | 原始记录 |
| Claude Sonnet 4.6 (Thinking (Max); Search and code; provider-specific tools)Anthropic | 49% | 原始记录 |
| Gemini 3 Pro (Thinking (High); Search and code; provider-specific tools)Google | 45.8% | 原始记录 |
| GPT-5.2 (Thinking (xhigh); Search and code; provider-specific tools)OpenAI | 45.5% | 原始记录 |
ARC-AGI-2 / Google G31 (2026-02-19)5 项成绩
从网格示例中推断陌生规律。
- Gemini 3.1 Pro77.1%
- Claude Opus 4.668.8%
- Claude Sonnet 4.658.3%
- GPT-5.252.9%
- Gemini 3 Pro31.1%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Gemini 3.1 Pro (Thinking (High); ARC Prize Verified; semi-private set)Google | 77.1% | 原始记录 |
| Claude Opus 4.6 (Thinking (Max); ARC Prize Verified; semi-private set)Anthropic | 68.8% | 原始记录 |
| Claude Sonnet 4.6 (Thinking (Max); ARC Prize Verified; semi-private set)Anthropic | 58.3% | 原始记录 |
| GPT-5.2 (Thinking (xhigh); ARC Prize Verified; semi-private set)OpenAI | 52.9% | 原始记录 |
| Gemini 3 Pro (Thinking (High); ARC Prize Verified; semi-private set)Google | 31.1% | 原始记录 |
AIME 2025, no tools / Google G3F (2025-12-17)7 项成绩
解答 2025 年 AIME 数学竞赛题。
- GPT-5.2100%
- Gemini 3 Flash95.2%
- Gemini 3 Pro95%
- Grok 4.1 Fast91.9%
- Gemini 2.5 Pro88%
- Claude Sonnet 4.587%
- Gemini 2.5 Flash72%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| GPT-5.2 (Extra high; No tools)OpenAI | 100% | 原始记录 |
| Gemini 3 Flash (Thinking; exact level unspecified; No tools)Google | 95.2% | 原始记录 |
| Gemini 3 Pro (Thinking; exact level unspecified; No tools)Google | 95% | 原始记录 |
| Grok 4.1 Fast (Reasoning; No tools)xAI | 91.9% | 原始记录 |
| Gemini 2.5 Pro (Thinking; exact level unspecified; No tools)Google | 88% | 原始记录 |
| Claude Sonnet 4.5 (Thinking; high preferred, otherwise best available reported setting; No tools)Anthropic | 87% | 原始记录 |
| Gemini 2.5 Flash (Thinking; exact level unspecified; No tools)Google | 72% | 原始记录 |
AIME 2025, code execution / Google G3F (2025-12-17)4 项成绩
解答 2025 年 AIME 数学竞赛题。
- Gemini 3 Pro100%
- Claude Sonnet 4.5100%
- Gemini 3 Flash99.7%
- Gemini 2.5 Flash75.7%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Gemini 3 Pro (Thinking; exact level unspecified; Code execution)Google | 100% | 原始记录 |
| Claude Sonnet 4.5 (Thinking; high preferred, otherwise best available reported setting; Code execution)Anthropic | 100% | 原始记录 |
| Gemini 3 Flash (Thinking; exact level unspecified; Code execution)Google | 99.7% | 原始记录 |
| Gemini 2.5 Flash (Thinking; exact level unspecified; Code execution)Google | 75.7% | 原始记录 |
HLE, no tools / Anthropic A51 (2026-09-01)3 项成绩
不使用工具完成原版 HLE 的 2,500 道多模态题目。
- Claude Fable 5.160.9%
- Claude Fable 557.8%
- Claude Opus 556.6%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Claude Fable 5.1 (Adaptive thinking (auto); max effort; default sampling; five-trial mean; total token cap 1M; no compaction; production safeguards enabled; No tools)Anthropic | 60.9% | 原始记录 |
| Claude Fable 5 (Detailed reasoning setting and budget unverified; production safeguards enabled; No tools)Anthropic | 57.8% | 原始记录 |
| Claude Opus 5 (Detailed reasoning setting and budget unverified; No tools)Anthropic | 56.6% | 原始记录 |
HLE, tools / Anthropic A51 (2026-09-01)3 项成绩
使用搜索、网页检索及代码工具的原版 HLE 推理评测。
- Claude Fable 5.165%
- Claude Fable 563.8%
- Claude Opus 563.6%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Claude Fable 5.1 (Adaptive thinking (auto); max effort; default sampling; five-trial mean; total token cap 1M; no compaction; production safeguards enabled; Search; restricted fetch; programmatic tool calling; code execution)Anthropic | 65% | 原始记录 |
| Claude Fable 5 (Detailed reasoning setting and budget unverified; production safeguards enabled; Search; restricted fetch; programmatic tool calling; code execution)Anthropic | 63.8% | 原始记录 |
| Claude Opus 5 (Detailed reasoning setting and budget unverified; Search; restricted fetch; programmatic tool calling; code execution)Anthropic | 63.6% | 原始记录 |
ARC-AGI-2 / Anthropic A51 (2026-09-01)4 项成绩
九月发布比较中的陌生网格规律推理评测。
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| GPT-5.6 Sol (Exact reasoning setting and token budget unverified)OpenAI | 92.5% | 原始记录 |
| Claude Opus 5 (Exact reasoning setting and token budget unverified)Anthropic | 90.42% | 原始记录 |
| Claude Fable 5.1 / Claude Mythos 5.1 (Fable 5.1: max effort; semi-private set; ARC Prize Verified)Anthropic | 90% | 原始记录 |
| Claude Fable 5 / Claude Mythos 5 (Exact reasoning setting and token budget unverified)Anthropic | 89.2% | 原始记录 |
HLE-Verified / Google G38 (2026-09-02)6 项成绩
采用经验证及修订的 1,811 道题进行专家推理评测。
- Gemini 3.8 Flash54.9%
- GPT-5.6 Sol54.5%
- Claude Opus 554.4%
- Gemini 3.7 Flash53.6%
- GPT-5.6 Terra51.1%
- Claude Sonnet 531%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Gemini 3.8 Flash (Default sampling; exact thinking level unspecified; HLE-Verified; 1811 items; tool use unspecified)Google | 54.9% | 原始记录 |
| GPT-5.6 Sol (Exact reasoning level unspecified; HLE-Verified; 1811 items; tool use unspecified)OpenAI | 54.5% | 原始记录 |
| Claude Opus 5 (Exact thinking level unspecified; HLE-Verified; 1811 items; tool use unspecified)Anthropic | 54.4% | 原始记录 |
| Gemini 3.7 Flash (Exact thinking level unspecified; HLE-Verified; 1811 items; tool use unspecified)Google | 53.6% | 原始记录 |
| GPT-5.6 Terra (Maximum reasoning preferred; otherwise best available reported setting; HLE-Verified; 1811 items; tool use unspecified)OpenAI | 51.1% | 原始记录 |
| Claude Sonnet 5 (Maximum thinking preferred; otherwise best available reported setting; HLE-Verified; 1811 items; tool use unspecified)Anthropic | 31% | 原始记录 |
文档与上下文理解
AA-LCR v1.115 项成绩
长上下文推理
- Kimi K388.67%
- Claude Fable 5.185.33%
- Muse Spark 1.384.33%
- Gemini 3.8 Flash84%
- GPT-5.6 Sol84%
- GPT-5.6 Luna83.67%
- Muse Glimmer83.33%
- GPT-5.3 Codex83.33%
- MiniMax-M383%
- GPT-5.6 Terra83%
- Gemini 3.7 Flash83%
- Agnes 2.5 Pro Beta83%
- Claude Fable 582.33%
- Claude Sonnet 582%
- Qwen3.8 27B82%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Kimi K3 (max)Kimi | 88.67% | 原始记录 |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 85.33% | 原始记录 |
| Muse Spark 1.3 (max)Meta | 84.33% | 原始记录 |
| Gemini 3.8 Flash (medium)Google | 84% | 原始记录 |
| GPT-5.6 Sol (max)OpenAI | 84% | 原始记录 |
| GPT-5.6 Luna (max)OpenAI | 83.67% | 原始记录 |
| Muse Glimmer (high)Meta | 83.33% | 原始记录 |
| GPT-5.3 Codex (xhigh)OpenAI | 83.33% | 原始记录 |
| MiniMax-M3MiniMax | 83% | 原始记录 |
| GPT-5.6 Terra (max)OpenAI | 83% | 原始记录 |
| Gemini 3.7 Flash (medium)Google | 83% | 原始记录 |
| Agnes 2.5 Pro BetaSapiens AI | 83% | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 82.33% | 原始记录 |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic | 82% | 原始记录 |
| Qwen3.8 27B (xhigh)Alibaba | 82% | 原始记录 |
MMMU-Pro15 项成绩
视觉推理
- GPT-6 Astra86.88%
- Gemini 3.8 Flash85.61%
- Gemini 3.7 Flash85.49%
- Claude Opus 584.74%
- Gemini 3.5 Flash83.87%
- GPT-5.6 Sol83.41%
- Gemini 3.6 Flash83.24%
- Gemini 3.1 Pro Preview82.43%
- Qwen3.8 Max82.31%
- Muse Spark 1.382.02%
- GPT-5.6 Terra80.69%
- Kimi K380.52%
- Qwen3.7 Plus80.46%
- Grok 4.580.4%
- Qwen3.8-Flash-Next79.77%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| GPT-6 Astra (max)OpenAI | 86.88% | 原始记录 |
| Gemini 3.8 Flash (high)Google | 85.61% | 原始记录 |
| Gemini 3.7 Flash (high)Google | 85.49% | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 84.74% | 原始记录 |
| Gemini 3.5 Flash (medium)Google | 83.87% | 原始记录 |
| GPT-5.6 Sol (max)OpenAI | 83.41% | 原始记录 |
| Gemini 3.6 Flash (high)Google | 83.24% | 原始记录 |
| Gemini 3.1 Pro PreviewGoogle | 82.43% | 原始记录 |
| Qwen3.8 MaxAlibaba | 82.31% | 原始记录 |
| Muse Spark 1.3 (xhigh)Meta | 82.02% | 原始记录 |
| GPT-5.6 Terra (max)OpenAI | 80.69% | 原始记录 |
| Kimi K3 (max)Kimi | 80.52% | 原始记录 |
| Qwen3.7 PlusAlibaba | 80.46% | 原始记录 |
| Grok 4.5 (high)SpaceXAI | 80.4% | 原始记录 |
| Qwen3.8-Flash-NextAlibaba | 79.77% | 原始记录 |
AA-Omniscience / Index15 项成绩
知识可靠性
- GPT-6 Astra43.73
- Claude Fable 5.143.45
- Claude Fable 543.3
- Claude Opus 537.07
- Gemini 3.1 Pro Preview31.88
- Grok 4.630.48
- Gemini 3.8 Flash29.55
- Muse Spark 1.227.2
- Gemini 3.7 Flash26.48
- Grok 4.525.32
- Muse Spark 1.324.93
- Gemini 3.6 Flash22.13
- GPT-5.6 Sol21.97
- Gemini 3.5 Flash20.82
- Kimi K319.7
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| GPT-6 Astra (high)OpenAI | 43.73 | 原始记录 |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 43.45 | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 43.3 | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 37.07 | 原始记录 |
| Gemini 3.1 Pro PreviewGoogle | 31.88 | 原始记录 |
| Grok 4.6 (high)SpaceXAI | 30.48 | 原始记录 |
| Gemini 3.8 Flash (high)Google | 29.55 | 原始记录 |
| Muse Spark 1.2 (xhigh)Meta | 27.2 | 原始记录 |
| Gemini 3.7 Flash (high)Google | 26.48 | 原始记录 |
| Grok 4.5 (high)SpaceXAI | 25.32 | 原始记录 |
| Muse Spark 1.3 (max)Meta | 24.93 | 原始记录 |
| Gemini 3.6 Flash (high)Google | 22.13 | 原始记录 |
| GPT-5.6 Sol (max)OpenAI | 21.97 | 原始记录 |
| Gemini 3.5 Flash (medium)Google | 20.82 | 原始记录 |
| Kimi K3 (max)Kimi | 19.7 | 原始记录 |
AA-Omniscience / Accuracy15 项成绩
知识问题正确率
- Claude Fable 5.167.23%
- Claude Fable 565.35%
- GPT-6 Astra62.6%
- Claude Opus 560.87%
- GPT-5.6 Sol59.4%
- Gemini 3.7 Flash55.32%
- Gemini 3.1 Pro Preview54.85%
- Gemini 3.8 Flash54.6%
- GPT-5.3 Codex52.88%
- Grok 4.551.55%
- Gemini 3.5 Flash51.05%
- Gemini 3.6 Flash49.97%
- DeepSeek V4 Pro 081349.1%
- Grok 4.648.23%
- Kimi K347.58%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 67.23% | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 65.35% | 原始记录 |
| GPT-6 Astra (max)OpenAI | 62.6% | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 60.87% | 原始记录 |
| GPT-5.6 Sol (max)OpenAI | 59.4% | 原始记录 |
| Gemini 3.7 Flash (high)Google | 55.32% | 原始记录 |
| Gemini 3.1 Pro PreviewGoogle | 54.85% | 原始记录 |
| Gemini 3.8 Flash (high)Google | 54.6% | 原始记录 |
| GPT-5.3 Codex (xhigh)OpenAI | 52.88% | 原始记录 |
| Grok 4.5 (high)SpaceXAI | 51.55% | 原始记录 |
| Gemini 3.5 Flash (medium)Google | 51.05% | 原始记录 |
| Gemini 3.6 Flash (high)Google | 49.97% | 原始记录 |
| DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek | 49.1% | 原始记录 |
| Grok 4.6 (high)SpaceXAI | 48.23% | 原始记录 |
| Kimi K3 (max)Kimi | 47.58% | 原始记录 |
AA-Omniscience / Hallucination15 项成绩
幻觉率,越低越好
- MiniCPM5-1B0.9%
- G9v3-3B11.66%
- G9v3-39A5B13.04%
- Command A+14.16%
- LFM2.5-2.6B16%
- Grok 4.316.94%
- Qwen3.8 27B18.09%
- MiniMax-M318.43%
- Quasar 438B21.44%
- K-EXAONE 2.0 080322.6%
- Grok 4.624%
- Solar Pro 424.4%
- MiMo-V2.5-Pro24.7%
- Solar Open2 250B25.38%
- Granite 4.2 30B25.58%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| MiniCPM5-1B (Non-reasoning)OpenBMB | 0.9% | 原始记录 |
| G9v3-3BAI9Stars | 11.66% | 原始记录 |
| G9v3-39A5BAI9Stars | 13.04% | 原始记录 |
| Command A+Cohere | 14.16% | 原始记录 |
| LFM2.5-2.6BLiquid AI | 16% | 原始记录 |
| Grok 4.3 (medium)SpaceXAI | 16.94% | 原始记录 |
| Qwen3.8 27B (Non-reasoning)Alibaba | 18.09% | 原始记录 |
| MiniMax-M3MiniMax | 18.43% | 原始记录 |
| Quasar 438B (max, based on GLM-5.2)Multiverse Computing | 21.44% | 原始记录 |
| K-EXAONE 2.0 0803 (K-EXAONE 2.0)LG AI Research | 22.6% | 原始记录 |
| Grok 4.6 (medium)SpaceXAI | 24% | 原始记录 |
| Solar Pro 4Upstage | 24.4% | 原始记录 |
| MiMo-V2.5-ProXiaomi | 24.7% | 原始记录 |
| Solar Open2 250BUpstage | 25.38% | 原始记录 |
| Granite 4.2 30BIBM | 25.58% | 原始记录 |
MathVision / Moonshot report5 项成绩
包含图像的数学题。
- Gemini 3 Pro86.1
- Kimi K2.584.2
- GPT-5.283
- Claude Opus 4.577.1
- Qwen3-VL-235B-A22B74.6
OCRBench / Moonshot report5 项成绩
图像中的文字识别。
- Kimi K2.592.3
- Gemini 3 Pro90.3
- Qwen3-VL-235B-A22B87.5
- Claude Opus 4.586.5
- GPT-5.280.7
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Kimi K2.5 (Thinking)Moonshot AI | 92.3 | 原始记录 |
| Gemini 3 Pro (High Thinking Level; publisher rerun (*))Google | 90.3 | 原始记录 |
| Qwen3-VL-235B-A22B (Thinking)Qwen | 87.5 | 原始记录 |
| Claude Opus 4.5 (Extended Thinking; publisher rerun (*))Anthropic | 86.5 | 原始记录 |
| GPT-5.2 (xhigh; publisher rerun (*))OpenAI | 80.7 | 原始记录 |
OmniDocBench 1.5 / Moonshot report5 项成绩
文档阅读。公布分数为归一化编辑距离的补数乘以 100。
- Kimi K2.588.8
- Gemini 3 Pro88.5
- Claude Opus 4.587.7
- GPT-5.285.7
- Qwen3-VL-235B-A22B82
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Kimi K2.5 (Thinking)Moonshot AI | 88.8 | 原始记录 |
| Gemini 3 Pro (High Thinking Level)Google | 88.5 | 原始记录 |
| Claude Opus 4.5 (Extended Thinking; publisher rerun (*))Anthropic | 87.7 | 原始记录 |
| GPT-5.2 (xhigh)OpenAI | 85.7 | 原始记录 |
| Qwen3-VL-235B-A22B (Thinking; publisher rerun (*))Qwen | 82 | 原始记录 |
VideoMMMU / Moonshot report5 项成绩
跨学科视频理解。
- Gemini 3 Pro87.6
- Kimi K2.586.6
- GPT-5.285.9
- Claude Opus 4.584.4
- Qwen3-VL-235B-A22B80
MotionBench / Moonshot report4 项成绩
理解视频中的运动。
- Kimi K2.570.4
- Gemini 3 Pro70.3
- GPT-5.264.8
- Claude Opus 4.560.3
IFBench / MiniMax report7 项成绩
遵循详细指令。
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| GPT-5.2 (Thinking; MiniMax internal evaluation)OpenAI | 75 | 原始记录 |
| MiniMax-M2.5 (MiniMax internal evaluation)MiniMax | 70 | 原始记录 |
| MiniMax-M2.1 (MiniMax internal evaluation)MiniMax | 70 | 原始记录 |
| Gemini 3 Pro (MiniMax internal evaluation)Google | 70 | 原始记录 |
| Claude Opus 4.5 (MiniMax internal evaluation)Anthropic | 58 | 原始记录 |
| Claude Sonnet 4.5 (MiniMax internal evaluation)Anthropic | 57 | 原始记录 |
| Claude Opus 4.6 (MiniMax internal evaluation)Anthropic | 53 | 原始记录 |
MMMLU / DeepSeek Base report3 项成绩
提供5个示例,以答案完全匹配率衡量的多语言知识。
- DeepSeek-V4-Pro-Base90.3%
- DeepSeek-V4-Flash-Base88.8%
- DeepSeek-V3.2-Base87.9%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| DeepSeek-V4-Pro-Base (Base; MMMLU EM; 5-shot; shared internal evaluation setup; sampling and tools not disclosed)DeepSeek | 90.3% | 原始记录 |
| DeepSeek-V4-Flash-Base (Base; MMMLU EM; 5-shot; shared internal evaluation setup; sampling and tools not disclosed)DeepSeek | 88.8% | 原始记录 |
| DeepSeek-V3.2-Base (Base; MMMLU EM; 5-shot; shared internal evaluation setup; sampling and tools not disclosed)DeepSeek | 87.9% | 原始记录 |
OmniDocBench 1.5 / Qwen3.8-27B report5 项成绩
使用提供方公布分数比较文档图像读取能力。
- Qwen3.7-Plus91.4
- Qwen3.8-27B91.1
- Qwen3.6-27B89.4
- Opus4.6 Max86.6
- Muse Glimmer-30B75.8
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Qwen3.7-Plus (OmniDocBench 1.5; tools, reasoning effort and image settings not disclosed)Qwen | 91.4 | 原始记录 |
| Qwen3.8-27B (OmniDocBench 1.5; tools, reasoning effort and image settings not disclosed)Qwen | 91.1 | 原始记录 |
| Qwen3.6-27B (OmniDocBench 1.5; tools, reasoning effort and image settings not disclosed)Qwen | 89.4 | 原始记录 |
| Opus4.6 Max (Max (table header); OmniDocBench 1.5 tools and image settings not disclosed)Anthropic | 86.6 | 原始记录 |
| Muse Glimmer-30B (OmniDocBench 1.5; tools, reasoning effort and image settings not disclosed)Meta | 75.8 | 原始记录 |
MMMU-Pro / Google G31 (2026-02-19)5 项成绩
不使用工具理解多模态信息并进行推理。
- Gemini 3 Pro81%
- Gemini 3.1 Pro80.5%
- GPT-5.279.5%
- Claude Sonnet 4.674.5%
- Claude Opus 4.673.9%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Gemini 3 Pro (Thinking (High); No tools; Standard (10 options) and Vision average)Google | 81% | 原始记录 |
| Gemini 3.1 Pro (Thinking (High); No tools; Standard (10 options) and Vision average)Google | 80.5% | 原始记录 |
| GPT-5.2 (Thinking (xhigh); No tools; Standard (10 options) and Vision average)OpenAI | 79.5% | 原始记录 |
| Claude Sonnet 4.6 (Thinking (Max); No tools; Standard (10 options) and Vision average)Anthropic | 74.5% | 原始记录 |
| Claude Opus 4.6 (Thinking (Max); No tools; Standard (10 options) and Vision average)Anthropic | 73.9% | 原始记录 |
MRCR v2, 128k / Google G31 (2026-02-19)5 项成绩
长上下文中检索 8 项指定信息,采用截至 128k 令牌的累计平均。
- Gemini 3.1 Pro84.9%
- Claude Sonnet 4.684.9%
- Claude Opus 4.684%
- GPT-5.283.8%
- Gemini 3 Pro77%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Gemini 3.1 Pro (Thinking (High); MRCR v2; 8 needles; 128k cumulative average)Google | 84.9% | 原始记录 |
| Claude Sonnet 4.6 (Thinking (Max); MRCR v2; 8 needles; 128k cumulative average)Anthropic | 84.9% | 原始记录 |
| Claude Opus 4.6 (Thinking (Max); MRCR v2; 8 needles; 128k cumulative average)Anthropic | 84% | 原始记录 |
| GPT-5.2 (Thinking (xhigh); MRCR v2; 8 needles; 128k cumulative average)OpenAI | 83.8% | 原始记录 |
| Gemini 3 Pro (Thinking (High); MRCR v2; 8 needles; 128k cumulative average)Google | 77% | 原始记录 |
MRCR v2, 1M / Google G31 (2026-02-19)2 项成绩
在 1M 令牌长度处检索 8 项指定信息的评测。
- Gemini 3.1 Pro26.3%
- Gemini 3 Pro26.3%
CharXiv Reasoning / Google G38 (2026-09-02)6 项成绩
不使用工具综合复杂图表中的信息。
- Gemini 3.8 Flash86.2%
- GPT-5.6 Terra85.9%
- GPT-5.6 Sol85.8%
- Gemini 3.7 Flash84.5%
- Claude Opus 583.7%
- Claude Sonnet 570.1%
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Gemini 3.8 Flash (Default sampling; exact thinking level unspecified; No tools)Google | 86.2% | 原始记录 |
| GPT-5.6 Terra (Maximum reasoning preferred; otherwise best available reported setting; No tools)OpenAI | 85.9% | 原始记录 |
| GPT-5.6 Sol (Exact reasoning level unspecified; No tools)OpenAI | 85.8% | 原始记录 |
| Gemini 3.7 Flash (Exact thinking level unspecified; No tools)Google | 84.5% | 原始记录 |
| Claude Opus 5 (Exact thinking level unspecified; No tools)Anthropic | 83.7% | 原始记录 |
| Claude Sonnet 5 (Maximum thinking preferred; otherwise best available reported setting; No tools)Anthropic | 70.1% | 原始记录 |
检索模型
MTEB / OpenAI embeddings report3 项成绩
文本嵌入模型评测,与生成式模型推理分开。
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| text-embedding-3-large (Published MTEB result; evaluation dimensions unspecified)OpenAI | 64.6% | 原始记录 |
| text-embedding-3-small (Published MTEB result; evaluation dimensions unspecified)OpenAI | 62.3% | 原始记录 |
| text-embedding-ada-002 (Published MTEB result; evaluation dimensions unspecified)OpenAI | 61% | 原始记录 |
时间与成本
Intelligence Index / Cost per task15 项成绩
评测任务加权平均成本
- GLM 5.3 Flash0.18
- Muse Spark 1.20.55
- Gemini 3.8 Flash0.74
- GPT-5.6 Terra0.81
- Muse Spark 1.30.96
- Qwen3.8 2.4T A95B1.1
- Qwen3.8 Max1.19
- GPT-5.6 Sol1.25
- Grok 4.61.25
- GLM-5.31.26
- Kimi K31.58
- GPT-6 Astra2.57
- Claude Opus 54.21
- Claude Fable 55.62
- Claude Fable 5.16.12
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 0.18 | 原始记录 |
| Muse Spark 1.2 (xhigh)Meta | 0.55 | 原始记录 |
| Gemini 3.8 Flash (high)Google | 0.74 | 原始记录 |
| GPT-5.6 Terra (max)OpenAI | 0.81 | 原始记录 |
| Muse Spark 1.3 (max)Meta | 0.96 | 原始记录 |
| Qwen3.8 2.4T A95BAlibaba | 1.1 | 原始记录 |
| Qwen3.8 MaxAlibaba | 1.19 | 原始记录 |
| GPT-5.6 Sol (max)OpenAI | 1.25 | 原始记录 |
| Grok 4.6 (high)SpaceXAI | 1.25 | 原始记录 |
| GLM-5.3 (max)Z AI | 1.26 | 原始记录 |
| Kimi K3 (max)Kimi | 1.58 | 原始记录 |
| GPT-6 Astra (max)OpenAI | 2.57 | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 4.21 | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 5.62 | 原始记录 |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 6.12 | 原始记录 |
Output speed15 项成绩
输出生成速度
- Gemini 3.8 Flash280.76
- Muse Spark 1.2269.24
- Muse Spark 1.3233.15
- GPT-5.6 Terra113.93
- GLM-5.383.31
- GPT-5.6 Sol75.78
- Claude Fable 5.168.22
- GPT-6 Astra64.26
- Claude Fable 562.97
- Grok 4.659.89
- Claude Opus 555.95
- GLM 5.3 Flash50.63
- Kimi K341.61
- Qwen3.8 2.4T A95B40.23
- Qwen3.8 Max40.15
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| Gemini 3.8 Flash (high)Google | 280.76 | 原始记录 |
| Muse Spark 1.2 (xhigh)Meta | 269.24 | 原始记录 |
| Muse Spark 1.3 (max)Meta | 233.15 | 原始记录 |
| GPT-5.6 Terra (max)OpenAI | 113.93 | 原始记录 |
| GLM-5.3 (max)Z AI | 83.31 | 原始记录 |
| GPT-5.6 Sol (max)OpenAI | 75.78 | 原始记录 |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 68.22 | 原始记录 |
| GPT-6 Astra (max)OpenAI | 64.26 | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 62.97 | 原始记录 |
| Grok 4.6 (high)SpaceXAI | 59.89 | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 55.95 | 原始记录 |
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 50.63 | 原始记录 |
| Kimi K3 (max)Kimi | 41.61 | 原始记录 |
| Qwen3.8 2.4T A95BAlibaba | 40.23 | 原始记录 |
| Qwen3.8 MaxAlibaba | 40.15 | 原始记录 |
API input price15 项成绩
每百万输入令牌价格
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 0.15 | 原始记录 |
| Gemini 3.8 Flash (high)Google | 0.75 | 原始记录 |
| Muse Spark 1.3 (max)Meta | 1.25 | 原始记录 |
| Muse Spark 1.2 (xhigh)Meta | 1.25 | 原始记录 |
| GLM-5.3 (max)Z AI | 1.4 | 原始记录 |
| Grok 4.6 (high)SpaceXAI | 2 | 原始记录 |
| Qwen3.8 MaxAlibaba | 2 | 原始记录 |
| GPT-5.6 Terra (max)OpenAI | 2 | 原始记录 |
| Qwen3.8 2.4T A95BAlibaba | 2 | 原始记录 |
| Kimi K3 (max)Kimi | 3 | 原始记录 |
| GPT-5.6 Sol (max)OpenAI | 4 | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 5 | 原始记录 |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 10 | 原始记录 |
| GPT-6 Astra (max)OpenAI | 10 | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 10 | 原始记录 |
API output price15 项成绩
每百万输出令牌价格
| 模型与运行配置 | 成绩 | 来源 |
|---|---|---|
| GLM 5.3 Flash (GLM-5.3-Flash)Z AI | 0.5 | 原始记录 |
| Gemini 3.8 Flash (high)Google | 3.75 | 原始记录 |
| Muse Spark 1.3 (max)Meta | 4.25 | 原始记录 |
| Muse Spark 1.2 (xhigh)Meta | 4.25 | 原始记录 |
| GLM-5.3 (max)Z AI | 4.4 | 原始记录 |
| Grok 4.6 (high)SpaceXAI | 6 | 原始记录 |
| Qwen3.8 MaxAlibaba | 6 | 原始记录 |
| Qwen3.8 2.4T A95BAlibaba | 6 | 原始记录 |
| GPT-5.6 Terra (max)OpenAI | 12 | 原始记录 |
| Kimi K3 (max)Kimi | 15 | 原始记录 |
| GPT-5.6 Sol (max)OpenAI | 20 | 原始记录 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 25 | 原始记录 |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic | 50 | 原始记录 |
| GPT-6 Astra (max)OpenAI | 50 | 原始记录 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 50 | 原始记录 |
正文来源与延伸阅读
- Anthropic. Demystifying evals for AI agents
- OpenAI. GDPval
- OpenAI. BrowseComp
- Parallel. Deep Research price-performance
- LangChain. Improving Deep Agents with harness engineering
- LangChain. Deep Agents source code
- DeepResearch Bench II. Evaluation code
- ResearchRubrics. Evaluation code
- Agents’ Last Exam. Tasks and evaluation