WikiSkill:将智能体经验编译为持久化知识以实现技能演化

发布时间:2026/10/1 9:36:42

WikiSkill:将智能体经验编译为持久化知识以实现技能演化 WikiSkill:将智能体经验编译为持久化知识以实现技能演化论文来源:arXiv:2608.27454v1摘要智能体技能(Agent skills)将专业知识与工作流封装成可复用资源,以此拓展AI智能体的能力。现有研究可以从智能体交互经验中自动挖掘技能,让智能体在交互过程中逐步自适应迭代。但是,用于指导技能迭代的经验洞察往往零散分布在优化历史中,无法在多轮迭代之间实现系统化复用。本文提出WikiSkill框架,让智能体技能与一套持久化知识库(Wiki)协同演化。WikiSkill 将原始执行经验、沉淀的结构化知识、可执行技能三者解耦;持续把交互经验汇总编译进入Wiki知识库,后续的技能更新迭代就可以基于这套积累的知识开展。在5个不同基准数据集、5款大模型上开展实验:WikiSkill 稳定超越现有SOTA技能演化方法,在绝大多数模型(S_{k‑1})数据集组合上优于无技能基线。实验发现:技能演化与模型缩放是互补关系。更大的模型通常能从演化得到的技能中获得更多收益;而配备演化技能的小模型,性能可以超过没有技能的更大规模模型。同时,演化得到的技能可以跨模型、跨模型家族有效迁移;其他模型演化出的技能,性能甚至可以优于模型自身演化的技能。消融实验证实,Wiki知识库的持久化知识积累,是实现高质量技能演化的关键。上述结果证明:系统化积累、精炼智能体交互经验,对开发可复用、可迁移的智能体技能具备显著价值。图1:WikiSkill对比无技能基线、现有技能演化方法。模型能力越强,WikiSkill带来的性能增益越明显;图中为各个模型在全部评测基准上的平均准确率。目录引言问题定义方法3.1 三层知识架构原始层(raw/)Wiki层(wiki/)技能层(skills/)3.2 演化智能体与Wiki调度逻辑3.2.1 推理智能体的技能供给3.2.2 Wiki维护器:模式整合归纳3.2.3 基于Wiki的技能提案器3.2.4 门控校验与回滚机制实验与结果4.1 实验设置数据集对比基线方法实验所用模型4.2 主要实验结果4.2.1 跨模型、跨任务的技能演化效果4.2.2 WikiSkill跨模型技能迁移实验分析与讨论5.1 持久化知识在技能演化中的作用5.2 定性分析:技能与Wiki的动态变化5.3 案例研究:Wiki引导技能演化完整过程相关工作6.1 基于经验的智能体技能演化6.2 技能增强智能体与智能体自我改进结论局限性AI生成声明参考文献附录A 方法细节A.1 完整算法伪代码A.2 被接受的技能更新分布统计B 数据集细节与数据划分小验证集下的评估鲁棒性C 实现细节统计显著性检验D 基线方法细节、优化器API调用分析D.1 各个基线方法介绍D.2 优化器API调用复杂度E 系统提示词与智能体提示词E.1 任务推理智能体系统提示E.2 Wiki维护器智能体系统提示E.3 技能提案器智能体系统提示((\mathcal{R})eAct模式)1 引言通用AI智能体越来越擅长跨领域完成复杂任务。但是,真实世界任务往往高度依赖领域专属的过程性知识、工作流。智能体技能提供一套轻量、开放格式来封装这类专业知识,不需要修改模型权重。技能把指令、脚本、资源打包为基于文件系统的模块化目录,具备一致性、可审计、可跨智能体复用;同时支持渐进式加载,智能体只在需要的时候加载对应内容,节省上下文窗口;技能让知识积累独立于模型参数之外。但人工编写智能体技能成本很高,需要提前预判智能体需要哪些过程知识。因此,大量最新工作迭代式开发技能:让智能体在训练集执行任务,分析成功、失败轨迹,基于交互经验迭代优化技能。现有方案(EvoSkill、Trace2Skill、SkillOpt)可以迭代更新技能,但不会把学到的经验沉淀为一套独立、持续演化的知识表示。借鉴Karpathy提出的LLM(S_{k‑1})Wiki思想:把交互经验编译成可持久、可不断累加的知识库。本文提出问题:能否把智能体的交互经验编译为持久化知识,支撑长期的技能演化?WikiSkill把智能体工作区划分为三层:原始层存储不可修改的执行轨迹、Wiki层维护结构化持久知识、技能层存放迭代更新的过程性技能。整个迭代循环包含4个组件:推理智能体:使用当前技能执行任务,生成执行轨迹;Wiki维护器:把轨迹信息整合沉淀进入Wiki知识库;技能提案器:结合Wiki知识库、最新轨迹,生成技能更新提案;门控与回滚机制:在验证集评估候选更新,只保留可以提升验证性能的改动。关键点:技能更新可以回滚,但是Wiki知识库永不回滚;后续每一轮迭代都可以复用全部历史沉淀知识。评测数据集覆盖五大领域:数学推理LiveMathematicanBench、网页检索问答SealQA、电子表格操作SpreadSheetBench、长文档问答OfficeQA、交互式具身任务ALFWorld;实验模型包含Qwen、Gemma、Gemini三大模型家族共5个模型。实验关键发现:WikiSkill在绝大多数场景超越基线;技能演化与模型缩放互补,Qwen系列中,4B、9B、27B模型使用WikiSkill后平均性能分别提升12.3%、17.5%、23.9%;技能可以弥补模型规模差距:Qwen(S_{k‑1})3.5(S_{k‑1})9B + WikiSkill(47.4%) Qwen(S_{k‑1})3.6(S_{k‑1})27B无技能(39.4%);技能支持跨模型家族迁移,部分场景迁移过来的技能比模型自己演化得到的技能效果更好;消融证实:Wiki持久知识库是获得性能增益的核心条件。主要贡献提出WikiSkill框架:智能体技能与持久化知识库协同演化,持续整理、精炼来自智能体交互的经验;在5套基准、5个模型完成验证,WikiSkill稳定优于现有技能演化方法;消融实验验证持久知识积累的必要性;系统研究演化技能与模型能力之间的相互作用:技能演化与模型缩放互补;技能可以跨模型有效迁移,部分场景迁移技能优于自演化技能。2 问题定义将任务数据集记为D=(xi,yi)∗i=1N\mathcal{D}={(x_{i},y_{i})}*{i=1}^{N}D=(xi​,yi​)∗i=1N,xix_ixi​为任务实例,yiy_iyi​为标准答案。数据集切分为互斥三部分:训练集D∗train\mathcal{D}*{\text{train}}D∗train、验证集D∗val\mathcal{D}*{\text{val}}D∗val、测试集D∗test\mathcal{D}*{\text{test}}D∗test。智能体π\piπ是基于大模型的系统,配备工具集合(U)\mathcal{(\mathcal{U})}(U)(bash、搜索API、文件读取器等),以及一套生效技能集合S=s1,s2,…,sMS={s_{1},s_{2},\dots,s_{M}}S=s1​,s2​,…,sM​。技能定义:模块化、基于文件系统的目录,封装领域过程知识,包含带元数据头的SKILL.md,记录名称、简短描述、完整过程指令、适用条件。技能集合初始化S0=∅S_{0}=\emptysetS0​=∅,在数据集上通过演化过程迭代开发。当执行任务xix_ixi​,智能体接收任务上下文,读取可用技能集合SSS,多步调用工具生成执行轨迹:τi∼π(xi;S)\tau_{i}\sim\pi(x_{i};S)τi​∼π(xi​;S)轨迹τi=(o1,a1,o2,a2,…,oT,aT)\tau_{i}=(o_{1},a_{1},o_{2},a_{2},\dots,o_{T},a_{T})τi​=(o1​,a1​,o2​,a2​,…,oT​,aT​),oto_tot​为观测,ata_tat​为动作(工具调用等),最终动作输出预测答案y^i\hat y_iy^​i​。领域打分函数f(y^i,yi)∈[0,1]f(\hat y_i,y_i)\in[0,1]f(y^​i​,yi​)∈[0,1]评估预测正确性。在数据集切片上跑完整智能体,得到一批轨迹集合T∗split\mathcal{T}*{\text{split}}T∗split,切片性能(R)(T∗split)\mathcal{(\mathcal{R})}(\mathcal{T}*{\text{split}})(R)(T∗split)为样本平均分。WikiSkill在第kkk轮迭代,系统状态为元组(Sk,Wk)(S_{k},W_{k})(Sk​,Wk​):SkS_{k}Sk​:当前生效的过程技能集合;WkW_{k}Wk​:持久化Wiki知识库。重要区别:候选技能更新会经过验证门控,性能下降时会回滚技能集合;但是Wiki知识库WkW_kWk​永远保留,不会回滚,知识可以跨迭代不断累加。初始状态(S0,W0)=(∅,∅)(S_{0},W_{0})=(\emptyset,\emptyset)(S0​,W0​)
延伸阅读

更多相关文章

2026/10/1 9:36:42

从零开始AI工程:模型部署、数据漂移与全链路最佳实践

1. 为什么是“从零开始”:AI工程到底在造什么如果你点进这篇文章,大概率和我一样,在某个深夜对着报错的训练脚本发过呆:模型明明在排行榜上跑得很好,为什么一落到自己的业务数据里就各种翻车?这就是我把项目…

2026/10/1 9:36:42

Java Web仓库管理系统实战:Spring Boot+MyBatis并发库存控制

简介:本资源是一套完整的Java Web仓库管理系统毕业设计实现方案,面向计算机专业本科生及课程大作业实践者,聚焦企业级库存管理核心业务场景,涵盖需求分析、系统设计、编码实现与部署验证全流程。压缩包体积59.99MB,包含…

2026/10/1 9:31:42

一键Office安装激活:LKY_OfficeTools

一键Office安装激活:LKY_OfficeTools 【免费下载链接】LKY_OfficeTools 一键自动化 下载、安装、激活 Office 的利器。 项目地址: https://gitcode.com/GitHub_Trending/lk/LKY_OfficeTools LKY_OfficeTools 是一个开源 Windows 工具,可一键自动下…

2026/10/1 10:31:45

关键字新闻爬虫实战:百度与今日头条数据采集入库全方案

简介:这是一份基于 Java 实现的新闻爬虫项目,覆盖百度新闻与今日头条两个信源,支持按关键字批量抓取新闻并写入数据库,适合需要采集新闻数据的 Java 开发者、数据分析人员或爬虫初学者参考。压缩包共 20 个文件,包含 1…

2026/10/1 10:31:45

AMD花82亿美元买世界模型,图什么?

导读: 一家以芯片闻名的公司,拟用约82亿美元的股票买下一家做「世界模型」的公司,还要让李飞飞出任首席科学家。AMD图的是什么?目前能确认的是交易安排和标的方向;技术怎么接入产品、钱怎样赚回来,仍要看后…

2026/10/1 10:31:45

Java面试中Redis缓存一致性怎么答?

面试官问缓存一致性,不是想听你背“先删缓存再更新数据库”或者“先更新数据库再删缓存”这两句话。他想知道的是:你知不知道这两种顺序在并发场景下分别会出什么问题,以及你实际项目里怎么选、怎么兜底。先更新数据库,再删除缓存…

2026/10/1 10:31:45

溶解氧时间序列预测:LSTM与EEMD-LSTM完整源码实战

简介:面向溶解氧浓度时序预测的深度学习项目,源自个人期末大作业并获97分,含完整可运行源码与全部实验数据,适合正在做课程设计或期末作业的计算机相关专业学生,也适合希望实战时序预测的进阶学习者。项目覆盖从数据读…

2026/10/1 10:26:45

内容平台雷达系统:实时流量监测与规则变化预警

1. 这个项目到底是什么“PLFM_RADAR”这个代号,最初是我们团队内部对“平台信号雷达”的简称——PLFM 是 Platform 的缩写,RADAR 就是雷达。项目核心就一句话:做一个持续运转的内容平台监测系统,实时感知平台规则变化、流量波动、…

2026/10/1 5:21:14

东莞市品牌网站建设报价常见报错与解决

东莞品牌网站建设报价单背后:一份保姆级建站教程避坑实录 网站做好了没人访问,这大概是很多老板最头疼的事。花了大几万做的品牌站,上线后流量惨淡,比路边摊还冷清。别急着骂外包公司,很多“东莞品牌网站建设报价”里藏着不少猫腻,比如用模板站冒充定制…

2026/9/29 21:48:03

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/29 7:00:49

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑