AI 与智能体

微软与 Hugging Face 发布智能体基准 ThinkingBox

发布日期
来源
微软与 Hugging Face 联合技术博客

摘要

微软与 Hugging Face 发布了 ThinkingBox 基准,它依据智能体留下的最终后端状态和副作用而非其文字或工具调用来评分。该基准对 507 个有状态业务流程各运行 20 次,可通过 OpenEnv 复现。按作者测量,最稳定的模型也只在 507 个任务中的 241 个(约 47%)上 20 次全部成功,说明一次成功并不等于可靠。

与我们工作的关联

它为部署会修改真实业务记录的智能体之前如何衡量可靠性提供了具体标准,可直接用于确定必须保留人工审核的环节。

本文译自韩文原文。 摘要可能经过翻译和编辑。评论是我们的解读,未来预测代表来源的观点。

阅读原文 (在新标签页中打开)