发布时间:2026/8/5 5:16:57
北大2篇Skill炸场,Agent彻底进化 一个Agent到底凭什么越来越强有人靠更大的模型有人靠更多数据但北京大学连发两篇论文给出了同一条答案让 Skill 自己进化。这两篇都来自北大一个叫VeriSkill管程序验证一个叫SESA管搜索问答自博弈。方向不同内核却高度一致——它们都不把Skill当成静态的、靠人手写的说明书而是当成一个会从失败里自我更新的活记忆。第一篇Self-Play MeetsSkillEvolution由中科院中科大北大清华等联合发表Skill这块清华也很高产SESA自博弈遇上进化SkillSESA面对的是另一类Agent——工具增强的搜索问答。自博弈能让 Agent 自己出题自己解但失败只贡献一个梯度不留持久状态外部Skill记忆又只从固定任务分布学。两边的毛病正好镜像自博弈会练但会忘Skill记忆会记但不会选题。SESA把过程记忆变成自博弈的进化状态用四个阶段闭环。SESA 概念总览一是记忆启动用 15 条手写加 142 条 bootstrap 挖出的技能共 157 条打底。二是不对称自博弈challenger 出题、solver 解题只有 solver 能检索技能防止解题策略泄漏给出题方。三是前沿塑形用钟形奖励把出题方推向 solver 能力边界附近的问题太简单太难的都罚保证失败是可学的。四是失败蒸馏把有用的失败提炼成技能写回记忆去重、按 help-hurt 淘汰、上限 800 条。SESA 训练环这个闭环的关键在于双向耦合技能更新改变 solver 行为solver 变强又改变 challenger 的奖励和未来题目分布新题目再制造新失败、改写记忆。任务生成和技能记忆一起进化。因为技能参与了训练轨迹SESA支持双路复用。最反直觉的结论来自关掉记忆的SESA-Off即便推理时不检索任何技能训练过的 solver 相对 SSP 仍有1.8Qwen3-4B和 2.2Qwen3-8B的提升。也就是说技能不是推理时的小技巧而是真的把能力烧进了模型参数再把记忆开回来还能再加 0.5 到 1.0 个点。总体看七个问答基准上SESA平均超过 SSP1.2 到 3.2 个点相对原始模型提升7.0 到 11.8 个点且跨 Qwen3、Qwen2.5、LLaMA-3.1、Search-R1 多个底座都成立。消融里失败蒸馏贡献最大去掉掉 2.7 个点前沿塑形掉 2.2记忆启动掉 1.5。对比已发布的 SkillRLSESA以 51.0 对 50.1 领先0.9 个点。训练动力学也印证了设计验证质量稳步上升后稳定活跃技能数先膨胀、后因去重和淘汰收缩——是会自我精炼的记忆而不是无限堆积。自进化动力学VeriSkill让验证失败变成可信的Skill更新程序验证是要证明一段代码满足形式化规范靠 Dafny、Frama-C、VeriFast 这类验证器。LLM Agent想全自动完成它离不开可复用技能。但验证器的反馈是失败的验证条件又晦涩又不直接可用。VeriSkill用三步把这种废信号变成可信更新。VeriSkill 总体框架第一步是责任归因。它把每次失败分成四类任务不可满足、证明器能力不足、技能不合规、技能知识缺口。前两类跟技能无关直接丢掉只留后两类作为进化信号。这一步挡住了最大的噪声来源。第二步是教训抽象。不为单个例子打补丁而是抽诊断签名——失败在哪、缺什么职责、技能文本怎么导致的失败——把同模式失败聚类再抽象成一条可复用 lesson并删掉实例细节避免把某个具体答案硬编码进技能。第三步是可执行验证。候选技能要在归因集和同模式迁移集上反复跑验证器只有严格提升验证成功率、且不破坏原程序语义才准许进入技能库。所有结果写进进化记忆指导下一轮。结果很硬。在三个验证器、两套 Agent 配置下VeriSkill六项全胜。相对无技能基线Dafny 提升43.3、Frama-C17.6、VeriFast46.0个百分点Claude Code / Opus 4.8换到 Codex / GPT 5.6 下VeriFast 直接51.3。即便对比最强的同类基线 SkillOpt-Lite它仍分别领先 15.0、9.1、5.7。消融实验说明三步缺一不可且可执行验证贡献最大去掉它PASS 从 57.3 掉到 36.0跌 21.3去掉责任归因跌 13.0去掉教训抽象跌 8.3。更值得在意的是迁移性。用 Codex 进化出的技能原封不动塞给 Terminus 框架下别的模型依然带来15.3 到 43.7个百分点的提升。这说明VeriSkill提炼的是可复用知识不是某个模型专属的 prompt 玄学。跨模型迁移性两篇合在一起说明了一件事VeriSkill和SESA场景差很远一个在形式化验证的硬骨头里一个在开放域搜索的自博弈里。但它们指向同一个判断Skill 不该是人手维护的死库而该是会从失败中自我进化的活记忆。对做 Agent 的人来说这意味着别再把精力全砸在 prompt 和模型规模上。把失败变成可复用、可验证、会自我更新的技能记忆才是 Agent 能持续变强的底层逻辑。北大这两篇把这条路铺得相当扎实。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

2026/8/5 5:16:57

爆火的腾讯WorkBuddy发了篇论文,公开了自家底牌

今天分享一篇腾讯WorkBuddy团队最新发表的论文,他们给自己造的内部尺子,现在把它开源了。 这篇论文不是孤立的学术工作,而是 WorkBuddy 产品工程的副产品——把内部的模型选型评测、Harness 回归测试、任务分布洞察打包成一个开源 Benchmark。…

2026/8/5 5:16:57

Linux网络实时监控利器nload:命令行流量分析实战指南

1. 为什么命令行流量监控依然是运维的“定心丸”在云原生和容器化大行其道的今天,各种图形化、Web化的监控面板层出不穷,PrometheusGrafana的组合几乎成了标配。但很多老运维或者深度Linux用户,依然会在终端里敲下nload这个命令。这不仅仅是一…

2026/8/5 5:16:57

OpenCode Go与GPT-5.6 Luna:构建AI代码助手的核心原理与工程实践

最近在技术社区看到不少关于“OpenCode Go 上线 GPT-5.6 Luna”的讨论,很多开发者对这个新工具既好奇又困惑。它到底是什么?是新的AI模型,还是一个集成开发工具?和之前的GPT系列有什么关系?本文将为你彻底拆解OpenCode…

2026/8/5 6:17:00

SFTP命令详解:从安全连接到文件传输与自动化脚本实践

1. 从FTP到SFTP:为什么安全传输在今天如此重要如果你还在用FTP(File Transfer Protocol)往服务器上传文件,那我得劝你赶紧停手。这就像在互联网上裸奔,你的用户名、密码、还有文件内容,都是以明文形式在网络…

2026/8/5 6:17:00

Linux文件权限批量修改实战:从chmod到find的精准控制

1. 从一次“权限不够”的报错说起那天下午,我正在服务器上部署一个刚写好的Python脚本,准备让它定时跑起来。脚本放在/opt/my_scripts目录下,我习惯性地用python3 /opt/my_scripts/data_processor.py执行,终端却冷冰冰地抛出一行字…

2026/8/5 6:17:00

用友U8接口API开发实战:从CO、EAI到OpenAPI的系统集成指南

1. 项目概述:为什么我们需要关注U8接口API开发?如果你在企业信息化、财务软件或者ERP实施领域工作,那么“用友U8”这个名字你一定不陌生。作为国内市场份额领先的中型ERP套件,U8承载了无数企业的核心业务流程,从财务、…

2026/8/5 6:17:00

MySQL存储过程与CALL语句:从基础语法到高级应用实战

1. 从一条“死命令”说起:为什么CALL语句总被忽视?如果你用过MySQL,肯定对SELECT、INSERT、UPDATE、DELETE这些语句熟得不能再熟了。它们就像是数据库里的“四大天王”,每天都要打交道。但提到CALL,很多人的反应可能是…

2026/8/5 6:17:00

MySQL存储过程与CALL语句:数据库逻辑封装与性能优化实战

1. 项目概述:从一条SQL语句到数据库逻辑的封装在数据库开发里,我们经常遇到一种情况:一段复杂的业务逻辑,比如计算用户积分、生成月度报表、或者处理订单状态流转,需要被反复执行。如果每次都把几十行甚至上百行的SQL语…

2026/8/5 6:12:00

前端时间处理实战:从new Date陷阱到服务器时间同步方案

1. 从一次线上故障说起:为什么new Date()不是万能的?那天下午,我正喝着咖啡,突然收到一连串的报警。一个核心的订单结算页面,用户反馈提交订单后显示的“预计送达时间”比实际晚了整整8个小时。这可不是小事&#xff0…

2026/8/5 3:13:11

如何用免费工具突破游戏窗口限制:SRWE完整使用指南

如何用免费工具突破游戏窗口限制:SRWE完整使用指南 【免费下载链接】SRWE Simple Runtime Window Editor 项目地址: https://gitcode.com/gh_mirrors/sr/SRWE 你是否遇到过这样的困扰?想为心爱的游戏截图,却发现游戏不支持自定义分辨率…

2026/8/5 0:01:34

三升四,比成绩下滑更可怕的,是孩子开始「认命」

分水岭上,最难的不是翻过去,是孩子不想翻了。八月初了。这两个字,对三升四的家长来说,比任何闹钟都让人清醒。最近的家长群里,气氛明显不一样了。一升二的在关心兴趣班,二升三的在讨论要不要提前学英语。而…

2026/8/5 0:01:34

Java缓存框架:JetCache

TOC 一、简介 JetCache 是一个 Java 缓存抽象框架,为不同的缓存解决方案提供了统一的使用方式。 它提供的注解比 Spring Cache 更加强大。 JetCache 的注解支持原生 TTL、两级缓存以及在分布式环境中的自动刷新功能,同时你也可以通过代码直接操作 Cach…

2026/8/5 0:01:34

AD 铺铜设置十字连接,过孔全连接,新版AD的简单设置

需求:通孔焊盘 十字花;过孔 Via 实心直连;贴片焊盘按需设置 AD 测试版本AD24 很多工程师踩坑:全部统一十字,导致接地过孔阻抗高、大电流发热! 一、快捷键打开规则 PCB 界面按下:D R 展开…

2026/8/3 22:40:58

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/3 13:26:41

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/3 16:43:13

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…