发布时间:2026/8/12 15:20:19
32 个软件应用、604 个工具,最强模型也只做对 38.6%——ICLR 2026 的 Toolathlon 揭了 Agent 评测的短 系列第 7 篇 · 子领域评测 / Evaluation【来源信息】 - 类型顶会论文 - 标题The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task ExecutionToolathlon - 作者/机构未具名通讯作者团队基于 MCP 服务器构建 - 出处ICLR 2026 · arXiv:2510.25726 - 原文https://zhaoyang97.github.io/Paper-Notes/ICLR2026/llm_agent/the_tool_decathlon_benchmarking_language_agents_for_diverse_realistic_and_long-h/ - 本文性质论文解读非原创研究关键结论以原文为准一句话结论现有 Agent 榜单多用「玩具级」单步任务分数虚高ICLR 2026 的 Toolathlon 用 32 个真实软件应用、604 个工具、108 个长程任务把最强模型 Claude 按在地上摩擦——成功率只有 38.6%。榜单测不出的差距才是真实差距。背景与痛点语言 Agent 要在真实世界干跨应用、多步骤的活管日历联动邮件、监控数据库出报告。这要求工具发现、多轮推理、状态追踪、跨系统协调一起上。但现有 Agent 基准三大硬伤领域窄聚焦单一工具或 API任务假一两步调用就完事环境假用空白或极简初始状态不是真实软件里的复杂数据。结果Agent 在简单榜上分数漂亮真实场景频繁翻车分数和实际能力严重脱节。核心方法讲人话Toolathlon 是第一个同时满足四个维度的 Agent 综合基准多样应用覆盖32 个软件应用、604 个工具真实环境状态不是空壳而是带真实复杂数据的初始状态长程复杂任务平均约 20 轮工具调用执行式验证不靠 LLM 裁判或字符串匹配而是基于程序执行做确定性判定。它基于 Model Context ProtocolMCP构建工具层部分由团队自研或修订保证接口质量和一致性。实验与数字108 个任务604 个工具32 个应用平均约20 轮工具调用。最强模型Claude-4.5-Sonnet 成功率仅 38.6%——这就是真实长程 Agent 能力的天花板。执行式验证确保每个任务完成与否有确定性判定杜绝 LLM 打分的主观误差。为什么重要反直觉点我们以为 Agent 已经很强是因为榜单太温柔。当任务变成「真实软件 长链路 多应用协调」连顶尖模型都不到四成。这对工程的直接意义别再拿单步工具调用榜当 KPI。你要测的是「在带真实数据的环境里跑 20 轮还不丢状态」的能力——这才是上线后用户真正会遇到的。复现 / 落地思路论文基于 MCP 服务器可自行搭建类似执行式评测用确定性校验脚本替代 LLM 裁判给你自己的 Agent 加一类「长程多工具」回归测试初始状态灌入真实数据参考 Toolathlon 的维度给你的 Agent 打分卡补上「环境真实性」和「轮次长度」两栏。今日可做的 3 件事把你现用的 Agent 评测从「单步准确率」升级成「执行式 长程 真实状态」三件套。用 MCP 把你的内部工具封装成标准接口照 Toolathlon 思路做一轮内部基准。给你的 Agent 设定一个「20 轮工具调用」压力测试看它在第几轮开始丢状态。下篇预告第 8 期我们读训练方法看 ICML 2026 一篇合成数据的信息论判据——为什么「模型自己教自己」用错了会崩用对了能不标注就训出推理能力。

相关新闻

2026/8/12 15:15:18

从伪多Agent到真全干专家:AI智能体协同架构的演进与实践

1. 从“伪多Agent”到“真全干专家”:一次认知升级最近在AI圈子里,“罗福莉说的‘伪多Agent’”这个梗挺火的。我一开始也没太在意,心想无非又是哪个新概念在炒作。直到我亲自上手试了试OmniWork这个平台,才真正理解了这句话背后的…

2026/8/12 15:15:18

03|如何从业务流程中提取对象、事件、状态、关系和规则

一张流程图画得越完整,是不是就越接近业务本体?食味里的新品上线团队起初也这么想。他们把市场立项、研发试制、质量评审、物料建码、供应准备、门店培训和POS启用画成一条端到端流程,再让AI把每个方框转成概念、把每条箭头转成关系。几分钟后…

2026/8/12 15:15:18

开源自动驾驶openpilot:架构解析与社区驱动的L2级辅助驾驶实践

1. 项目概述:当开源代码在专业评测中击败了行业巨头 如果你关注自动驾驶技术,最近几年可能听过一个名字: openpilot 。它不是某个科技巨头的秘密项目,而是一个由社区驱动的、完全开源的自动驾驶辅助系统。最让人津津乐道的是&a…

2026/8/12 16:20:26

Flutter路由进阶:从Navigator到GoRouter的完整实践指南

1. 从 Navigator 到 GoRouter:为什么我们需要新的路由方案?如果你是从 Flutter 1.x 时代走过来的开发者,提到路由,脑子里蹦出来的第一个词大概率是Navigator.push和MaterialPageRoute。这套基于Navigator的 API 简单直接&#xff…

2026/8/12 16:20:26

Python 3.13 Per-Interpreter GIL:解锁多核并行的新纪元

1. 项目概述:为什么我们需要“真正”的多线程?“Python多线程是假的。” 这句话在开发者社区里流传已久,几乎成了共识。但凡写过Python并发程序的同行,都体会过那种尴尬:明明开了好几个线程,CPU占用率却死活…

2026/8/12 16:20:26

Win11系统下农业银行K宝无法识别与驱动签名错误的系统性解决方案

1. 问题现象与核心场景定位最近在给几家中小企业的财务同事做系统升级后的技术支持,发现一个挺普遍的问题:在将办公电脑升级到Windows 11系统后,之前用得好好的农业银行企业网银K宝,突然就“罢工”了。具体表现五花八门&#xff0…

2026/8/12 16:20:26

Java 面向对象基础笔记:图形化编程

概述 本文面向变成零基础小白,用具体通俗的方法讲述如何用JAVA语言设计带操作界面的应用程序 一、核心概念 标准库:当前这门语言设计好的基础功能 组件(登录):账号/密码输入框 登录/注册按钮 窗体 图片 二、核心组件及其在标准库中的名称…

2026/8/12 16:20:26

从0搭建高可用代理IP池:爬虫稳定采集的核心方案

在数据采集过程中,爬虫程序经常会遇到访问失败、请求超时、频繁验证等问题。随着网站反爬机制不断完善,仅依靠单一网络出口已经很难满足长期、大规模的数据采集需求。因此,很多爬虫系统会引入代理IP池,通过动态管理多个访问节点&a…

2026/8/12 16:15:26

VulkanSceneGraph学习教程(五)

第 5 章 第一个 VSG 程序:创建窗口并渲染一个三角形本章定位:这是整套教程的第一个完整可运行示例,也是后续所有章节的写作模板。 请从「目标 → 前置准备 → 完整代码 → 逐段解析 → 构建与运行 → 运行效果 → 常见问题 → 小结 → 延伸阅…

2026/8/12 10:37:12

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/12 5:35:25

当 LLM 遇见大文档:主流开源项目如何处理上下文超限

从 Agentic Loop 到 Repo Map,七种策略与六类陷阱引言:128K vs 10MB 的硬冲突 2026 年的 LLM 上下文窗口已达到 128K ~ 1M token(≈ 0.5MB ~ 4MB 文本),但 LLM 想要处理的真实数据规模远远超过这个量级:真实…

2026/8/12 9:34:08

Ubuntu 23.10中双击运行.sh文件的完整指南:从权限原理到桌面配置

1. 项目概述:从一次“双击”引发的权限探索在Ubuntu桌面环境下,我们习惯了双击运行那些带有.exe后缀的Windows程序安装包,但当你拿到一个以.sh结尾的Shell脚本文件时,满怀期待地双击它,却很可能只看到一个文本编辑器窗…

2026/8/12 9:34:08

NumPy条件索引实战:np.where与np.argwhere高效数据筛选指南

1. 从一次数据筛选的“笨办法”说起 前几天,我帮一个刚入行的数据分析师同事看代码,他正在处理一批传感器数据,需要找出所有温度超过阈值的数据点,然后进行后续分析。我一看他的实现,好家伙,一个 for 循环…

2026/8/12 9:34:08

基于Docker与Selenium Grid构建高可用浏览器自动化测试环境

1. 项目概述:为什么需要容器化的浏览器自动化?在软件开发和测试领域,浏览器自动化早已不是新鲜事。无论是日常的UI回归测试、数据抓取,还是复杂的业务流程模拟,Selenium都是我们绕不开的利器。然而,但凡在团…

2026/8/10 11:20:30

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/11 17:06:59

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/11 3:05:11

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…