SkillsBench用7308条轨迹揭示真相:Agent技能真的能提升性能吗?

发布时间:2026/10/11 19:43:34

SkillsBench用7308条轨迹揭示真相:Agent技能真的能提升性能吗? 人工智能大模型AI 评测Agent 评测【免费下载链接】skillsbenchSkillsBench evaluates how well skills work and how effective agents are at using them.项目地址https://gitcode.com/gh_mirrors/sk/skillsbench点击查看免费下载SkillsBench是目前首个专门评测AI Agent Skills智能体技能的开源基准benchmark它用同一任务 × 有无技能 × 多次重复的配对实验跑出了7,308 条真实执行轨迹来回答一个关键问题——给 Agent 挂载技能文件Skills到底能不能、以及在多大程度上提升任务成功率本文用通俗的方式带你读完这些数据的结论。Agent技能是什么为什么需要基准测试先说结论性的背景大模型很聪明但缺乏程序性知识procedural knowledge——即这类工作该怎么一步步做的领域惯例和标准操作。微调太贵于是业界流行给 Agent 挂载技能包一个包含指令、脚本、参考资料的结构化文件夹在推理时动态加载不改模型本身。可以把它类比成模型是 CPUAgent 运行框架harness是操作系统技能就是安装的应用程序。社区里已经出现了数万个用户贡献的技能GitHub 上 45k 的 SKILL.md但一直没有基准系统性地回答技能真的有用吗多少有用什么时候反而有害SkillsBench 就是为此而生。基准构成配对实验设计是关键SkillsBench 的方法论核心是配对评估paired evaluation同一任务在同一个 Docker 容器里分别跑三种条件——Condition A无技能只有任务指令Condition B挂载专家编写的技能包指令中不点名技能考察 Agent 是否会主动调用Condition C自生成技能让 Agent 先自己写技能再解题任务覆盖11 个专业领域软件工程、自然科学、网络安全、金融、制造、医疗等按人工耗时分为 Core / Extended / Extreme 三档难度。任务由 105 位贡献者提交经过自动校验 人工审核两级筛选。每个任务都是自带确定性验证器程序化断言不用 LLM 当裁判的独立容器保证结果可复现。想亲手复现实验流程可以打开仓库里的 experiments/run_experiment.ipynb 实验笔记本任务分类学定义见 taxonomy.md。核心发现一技能平均提升16个百分点但差异巨大在 7 种 Agent 模型组合、84 个任务、每任务 5 次试验合计约 7.3k 次试跑中所有配置在挂载技能后性能都上升了平均 16 个百分点区间为13.6 ~ 23.3Agent 模型无技能有技能提升Gemini CLI (Gemini 3 Flash)31.348.717.4Claude Code (Opus 4.5)22.045.323.3Codex (GPT-5.2)30.644.714.1v1.1 版本进一步扩大到87 个任务 × 18 种模型-框架组合平均解决率从33.9% 提升到 50.5%16.6 分所有配置均为正增益。核心发现二技能可能帮倒忙——盲目挂载是危险的技能并非处处增益。在 v1 的 84 个任务中16 个任务出现负向效果最惨的一个任务掉了 39.3 分软件工程、数学这类模型预训练覆盖充足的领域增益最小4.5 ~ 6.0 分。v1.1 中仍有13/87 个任务技能后效果反而变差。规律很清晰模型越不擅长的领域技能越值钱模型已经见过很多的专业外部程序性指导的边际价值就小。所以实践建议是——先小规模 A/B 测试再决定给哪个领域挂技能。核心发现三模型自己写的技能反而拉低性能最反直觉的一条让 Agent自己先生成技能再解题Bring Your Own Skills 条件结果不如不挂技能——在 v1.1 的三个配置上分别下降 8.1 / 11.3 / 11.5 分而同期专家技能包带来 18.2 ~ 24.8 分的提升。轨迹分析揭示了两种失败模式模型要么写出的技能过于笼统比如只写用 pandas 处理数据却没有任何具体 API 模式要么根本没意识到任务需要专业技能。有效的技能需要人类领域的专家经验模型目前无法可靠地自我生产。核心发现四小模型好技能可替代大模型成本敏感的朋友重点看这条Haiku 4.5 技能27.7%明显超过了 Opus 4.5 无技能22.0%。用更便宜、更小的模型配上正确的程序性知识可以追平甚至反超更大模型裸跑的表现在 v1.1 中同样成立GLM 5.1 技能58.4%超过了 Opus 4.8 无技能45.7%。从7,308条轨迹提炼的好技能设计准则论文对轨迹做了逐条归因沉淀出几条非常实用的技能设计准则数量上少即是多每任务2~3 个技能增益最优v1.1 中 19.0 分堆到 4 个以上收益骤降至 10.1 分长度上精简胜冗长紧凑/标准长度技能增益 19~21.5 分百科全书式技能只有 0.7 分可运行代码示例是最大增量从纯文字说明升级到带可执行示例是性能跳变最大的一步调用率差异巨大技能调用率Skill Invocation Rate在不同框架间从46% 到 99%不等——你的 Agent 框架是否会主动读取技能文件本身就决定了收益上限意外收获挂载技能后平均单任务耗时反而从 14.5 分钟降到 13.8 分钟又快又准。如何上手与参与快速上手与任务验证流程见 README.md贡献新任务的完整规范见 CONTRIBUTING.md实验配置含各框架的有/无技能对照 YAML在 experiments/configs/ 下v1.1 完整结果与解读见 website/src/content/news/skillsbench-1-1.mdx社区技能生态调研2M 技能快照的分类、去重、相似度分析在 docs/skills-research/想跑本地实验克隆仓库git clone https://gitcode.com/gh_mirrors/sk/skillsbench再安装 BenchFlow CLI 即可验证任务结论7,308 条轨迹给出的答案相当明确技能确实能提升 Agent 性能平均 16 分左右但增益高度依赖于领域 × 技能质量 × 框架三重匹配。技能不是免费午餐——写错的技能会拖后腿模型也还不会自己写好技能。对使用者的落地建议就一句话挑对领域、保持精简、带上可运行示例、先小范围验证再全面铺开。赞分享人工智能大模型AI 评测Agent 评测【免费下载链接】skillsbenchSkillsBench evaluates how well skills work and how effective agents are at using them.项目地址https://gitcode.com/gh_mirrors/sk/skillsbench点击查看免费下载相关推荐SkillsBench调研4.7万个AI技能5985个仓库揭示Agent技能生态的真实面貌SkillsBench调研4.7万个AI技能5985个仓库揭示Agent技能生态的真实面貌 AI技能Skills正在成为AI编程代理生态中最活跃的一环但人工智能大模型AI 评测Agent 评测VRR测试真的能提升你的显示器性能吗一键验证指南VRR测试真的能提升你的显示器性能吗一键验证指南 还在为游戏画面撕裂而烦恼吗可变刷新率技术或许正是你需要的解决方案今天我们将通过VRRTest这款轻量级工开发工具智能视频解说真的能提升90%制作效率吗NarratoAI技术深度揭秘智能视频解说真的能提升90%制作效率吗NarratoAI技术深度揭秘 在数字内容爆炸的时代视频创作者面临着巨大的效率挑战。NarratoAI作为一款利用AIAI 应用大模型音视频语音媒体生成创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/10/11 19:43:34

线性回归可执行教案:从推导到代码的完整复现

简介:本资源是一份面向机器学习初学者与课程小组作业场景的线性回归算法教学型PPT,系统梳理了线性回归的核心原理、数学推导与优化方法,并对比延伸至逻辑回归,助力理解监督学习中回归与分类任务的本质差异。内容涵盖真实案例&…

2026/10/11 19:43:34

WINCC SQL报表开发:VBScript+ActiveX实现查询打印

简介:面向工业自动化领域的WinCC组态与报表开发人员,这份文档系统讲解如何利用VBScript脚本语言,结合MSFlexGrid与MS DTPicker控件,在SIMATIC WinCC中实现SQL数据库查询与报表展示,解决生产数据实时监控与分析的需求。…

2026/10/11 20:48:40

三农HTML5网站本地运行与语义化优化实战指南

简介:这是一份面向高校计算机专业学生及前端初学者的HTML5毕业设计实战源码,聚焦三农主题,涵盖有机农业、农产品展销、生态农庄与农旅融合等典型场景,适用于课程大作业、毕设选题或网页设计实训。资源包共36个文件,含2…

2026/10/11 20:48:40

货架空缺检测数据集:4470张双格式标注与YOLOv8实战

简介:本资源为面向零售智能化与计算机视觉方向的超市货架空置缺货检测数据集,适用于目标检测模型训练、货架陈列分析及补货预警等场景,适合具备一定深度学习基础的研究者与算法工程师使用。数据集共4470张jpg图片,每张均配有对应的…

2026/10/11 20:48:40

数据库模型设计实战:从概念模型到DDL落地的完整方法论

简介:面向数据库设计初学者与开发人员的一份文档资料,系统讲解概念模型、逻辑模型、物理模型的核心概念与相互区别,并结合ERWIN、PowerDesigner两款常用建模工具,梳理从概念到逻辑再到物理的完整设计路径。文中指出ERWIN主要提供逻…

2026/10/11 20:43:40

C# OpenCvSharp DNN 人脸朝向估计:从关键点到欧拉角实战

简介:本资源为C# OpenCvSharp DNN人脸朝向估计完整源码工程,面向具备一定C#基础、希望入门计算机视觉与深度学习部署的开发者。项目通过OpenCvSharp封装库结合DNN模块加载预训练模型,实现从人脸检测、图像预处理、模型前向传播到角度后处理输…

2026/10/11 0:02:13

Python调用Gemini Structured Outputs实现工单路由门禁

客服工单最怕的不是模型“答错一句话”,而是它给出一段看起来合理的说明,程序却从中猜错优先级。通俗做法是:要求模型只交 JSON(JavaScript Object Notation,轻量数据格式),再让代码验证它。Gem…

2026/10/11 0:02:13

Spring Boot超市进销存系统毕设实战:从需求拆解到答辩通关

最近带的一个学生项目组里,有A同学跑来问我:选什么毕设题目最稳妥,既能让评审老师觉得工作量够,又不会在答辩时被问到语无伦次。我第一反应就是推荐基于Spring Boot的超市仓库管理系统——也就是超市进销存系统。这个题目乍一看平…

2026/10/11 0:02:13

Flutter StatefulWidget 生命周期核心解析

很多刚开始接触 Flutter 的朋友,在看完一堆“Hello World”和基础组件之后,大概率都会撞上同一堵墙:StatefulWidget 里那堆 initState、build、dispose 方法,到底什么时候被调用?为什么顺序是那样?在里面到…

2026/10/11 0:02:13

Python调用Gemini Structured Outputs实现工单路由门禁

客服工单最怕的不是模型“答错一句话”,而是它给出一段看起来合理的说明,程序却从中猜错优先级。通俗做法是:要求模型只交 JSON(JavaScript Object Notation,轻量数据格式),再让代码验证它。Gem…

2026/10/11 0:02:13

Spring Boot超市进销存系统毕设实战:从需求拆解到答辩通关

最近带的一个学生项目组里,有A同学跑来问我:选什么毕设题目最稳妥,既能让评审老师觉得工作量够,又不会在答辩时被问到语无伦次。我第一反应就是推荐基于Spring Boot的超市仓库管理系统——也就是超市进销存系统。这个题目乍一看平…

2026/10/11 0:02:13

Flutter StatefulWidget 生命周期核心解析

很多刚开始接触 Flutter 的朋友,在看完一堆“Hello World”和基础组件之后,大概率都会撞上同一堵墙:StatefulWidget 里那堆 initState、build、dispose 方法,到底什么时候被调用?为什么顺序是那样?在里面到…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑