发布时间:2026/7/28 9:09:34
一篇双引擎进化的长程Agents系统性综述 今天分享人大北大清华等联合发表的最新长时程Agent综述这篇149页的综述给出了长时程AgentLong-Horizon Agent的第一个统一形式化定义Agent πθ ⊕ H即”基座策略 ⊕ 运行时Harness”的耦合系统并把整个领域梳理成一条”外化Harness工程×内化模型优化”的双螺旋共演化主线用六个视角串起了从Prompt工程到Harness的完整技术版图。一、概念混战终结者“自我进化Agent”“自主Agent”“长时运行Agent”……这些词在社区里长期混用导致一个问题长时程能力的进步到底该归功于模型还是工程没人说得清。Figure 1 长时程Agent研究全景这篇综述的核心主张是长时程能力不是基座模型单独的属性而是外化Harness工程loops、记忆、工具、编排、Hooks、验证与内化模型优化架构、数据、训练、RL、自进化共演化的产物——Harness机制逐步被内化进策略更强的策略又反过来解锁更高级的Harness。Figure 2 全文分类法全文的分类法也按这条主线展开从演化史、Harness六大组件、优化全生命周期到五大应用形态与前沿开放问题二、Foundation第一次把长时程说清楚2.1 定义看依赖链不看时长论文明确反对用”跑了多久”来定义长时程。真正的判据是任务内部耦合的逻辑依赖一个长时程任务可能一开始就欠规范、需要在求解中逐步澄清解法路径多、子任务深度耦合必须把大量相互依赖的决策组合成一条连贯轨迹才能完成。形式化地长时程Agent被建模为基座策略 πθ 与Harness结构 H 的运行时耦合Agent πθ ⊕ H其中 H 决定模型何时被调用、动作如何被校验执行、什么状态跨步骤持久化整个系统在部分可观环境下运行POMDP奖励稀疏且延迟——这正是长时程信用分配难题的根源。2.2 三级任务 × 三级能力论文用”执行要跨出单个工作上下文多远”作为可操作的分级轴Figure 3 三级任务与能力级别任务形态要求的能力H1上下文内~分钟一个窗口内完成但决策链高度耦合C1上下文内交互式推理行动、吸收反馈、修正轨迹H2跨上下文~小时到天任务远超一个窗口需跨窗口/多Agent接力C2跨上下文状态与记忆压缩外化历史、读写记忆、断点续跑H3跨任务流~终身开放式任务流一个总目标横跨多个任务C3跨任务经验积累沉淀可复用技能、持续变强三者嵌套C1 ⊂ C2 ⊂ C3每级都在前一级之上叠加新的失效模式。2.3 前沿Agent的时间视界正在加速翻倍基于METR截至2026年5月8日的实测数据前沿Agent的50%任务完成时间视界从GPT-2时代的秒级涨到 Claude Opus 4.6 的约12小时、Claude Mythos Preview 的≥16小时——几年内跨了近4个数量级。拟合的翻倍时间约196.5天6.5个月若只看2023年后的新方法论序列翻倍时间缩短到130.8天4.3个月——在加速。Figure 4 前沿Agent时间视界的经验增长2.4 与三个相邻概念划清界限长时程Agent ≠ 长时运行跑批不依赖耦合决策、≠ 自主Agent自主是治理属性长时程是能力属性、≠ 自进化Agent自进化只是服务H3的一种机制。它是三者的交集而非任何一个的子集。Figure 5 与相邻概念的关系三、Evolution控制面三次外扩——Prompt → Context → Runtime论文把领域演进梳理为三个嵌套而非替代的阶段每阶段都由基座模型能力跃迁开启、被新的长时程瓶颈终结Figure 6 三阶段共演化Stage IPrompt Engineering2020–2023。唯一能动的控制面是”查询的语言”。CoT、Zero-shot CoT 证明推理能力是潜藏在权重里的Self-Consistency、Least-to-Most、Plan-and-Solve、ToT 搭出了”分解-规划-执行-修正”的Agent雏形InstructGPT 则完成了第一次”Harness→策略”的能力内化。Stage IIContext Engineering2023–2025。控制面扩大到”模型能看到什么信息”RAGHyDE、RAPTOR、Self-RAG打通外部证据Toolformer、Gorilla、ReAct 打通工具调用MemGPT 等开始管理上下文与记忆。Stage IIIRuntime Harness2025至今。控制对象变成整条轨迹Agent Loop、Hooks、治理机制环绕模型运转长时程Agent才真正登场。Table 1 三阶段对比四、Harness能力外化的六大组件这是全文的”Pillar I”。Harness是让长时执行可规约、可操控、可验证、可恢复的运行时层论文拆成六个组件Figure 7 Agent Harness总览Loops Workflows线性流一条演进轨迹、Plan-Execute显式跟踪与子目标、分支流先评估后承诺maker-checker分离防自评偏差。Context Memory工作上下文的丢弃/压缩/选择 持久记忆的内容与操作——Harness是工作流与状态之间的接口治理者。Figure 8 上下文与记忆Tools, MCP Skills工具接口与协议、主动工具发现、技能库——MCP解决M×N集成问题Skill库让经验以可调用资产沉淀。Orchestration任务分解与角色、协调拓扑、编排优化、Agent间协议A2A等。Figure 9 编排总览Hooks Middleware预定义规则Hook、自定义Hook、运行时自适应Hook不确定度驱动/行为驱动/威胁驱动——从被动执行壳变成主动控制器。Figure 10 Hooks与中间件Verification评估对象正确性/安全/忠实性/多Agent、验证层级步骤级/运行结束级、验证器策略自动标签与奖励、验证器引导搜索、计算最优验证。五、Optimization能力内化的七段流水线“Pillar II”回答Harness脚手架里的能力如何逐步内化进模型权重。论文给出一条完整的Agentic训练流水线Figure 11 Agentic训练流水线架构基座显式上下文、压缩状态、混合架构、高吞吐机制——决定长轨迹能否被表示、训练、低成本解码数据与环境合成任务、环境、轨迹三类合成提供可验证的长时程经验预训练/中训注入推理先验、长上下文状态、多模态感知让Agent行为”原生”而非”提示出来”微调指令选择与混合、课程学习、蒸馏灌输行为与工具使用纪律Agentic RL直面稀疏延迟奖励下的长时程信用分配围绕四个关键问题展开——信用分配、策略优化、采样策略、交互模式Figure 12 Agentic RL四问On-Policy蒸馏在策略自身状态分布上巩固行为减少分布偏移自进化离线自进化生成-过滤-训练、在线自进化实时交互中学习、Agent-环境共进化难度与分布同步调整维持”可学习的能力边界”。Figure 13 自进化三模式各阶段的机制与代表作对应关系见下表Table 5 Agentic训练流水线各阶段六、Application按Agent-环境接口分的五大形态论文不按行业、而按接口结构组织应用——因为接口决定了观测、动作、状态与反馈的形态也就决定了长时程压力的形态Figure 14 五大应用形态从”有界可验证环境”到”开放异构世界”反馈信号一路减弱长时程难度一路升高。对应的系统与评测资源SWE-bench、WebArena、OSWorld、GAIA、Terminal-Bench、METR等汇总于论文Table 7Table 7 代表性系统与基准七、Frontier四轴九向Harness是下一个主战场论文最后把开放问题组织成四条轴、九个具体前沿Table 8 四轴九前沿一个反复出现的判断下一阶段的突破大部分要发生在Harness层。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

2026/7/28 13:39:54

Python Pygame游戏开发实战:从零制作中秋接金币月饼小游戏

1. 项目概述与核心思路 最近中秋临近,想着用Python的Pygame库做个应景的小游戏,既能练手,又能感受节日氛围。这个“接金币月饼”游戏,顾名思义,核心玩法就是控制一个角色(比如一个可爱的玉兔或者月饼盘子&a…

2026/7/28 13:39:54

AI陪伴系统技术解析:长期记忆、个性养成与部署实践

1. 先搞清楚“闪退又解禁”背后是什么 “闪退又解禁”这种说法,听起来像是一个软件或服务经历了上线、崩溃、修复、重新开放的完整周期。在AI领域,这种情况并不少见——尤其是当一个新模型或平台首次面对大规模真实用户时。 从技术角度看,“闪退”通常意味着几种可能:服务…

2026/7/28 13:39:54

如何快速激活Windows系统:开源工具的完整指南

如何快速激活Windows系统:开源工具的完整指南 【免费下载链接】KMS_VL_ALL_AIO Smart Activation Script 项目地址: https://gitcode.com/gh_mirrors/km/KMS_VL_ALL_AIO 还在为系统激活弹窗烦恼吗?KMS_VL_ALL_AIO智能激活脚本为您提供了一套完整的…

2026/7/28 13:39:54

AI驱动序列优化:从RNA疫苗设计到通用工程实践

在实际生物信息学和疫苗研发领域,RNA分子的稳定性和翻译效率是决定其能否成为有效疫苗或治疗工具的关键瓶颈。许多精心设计的RNA序列,由于二级结构不稳定或翻译起始位点不佳,在细胞内变成了“无用”的RNA,无法高效地指导蛋白质合成。传统优化方法依赖大量实验试错,成本高昂…

2026/7/28 13:39:54

Python requests库高级用法:Session与连接池优化实战

1. 为什么需要关注requests库的高级用法 在日常Python开发中,requests库几乎成了HTTP请求的代名词。但很多人只停留在简单的get/post调用层面,当遇到复杂场景时就束手无策。最近接手一个需要每天处理50万次API调用的项目时,我发现基础用法根本…

2026/7/28 13:34:54

物联网设备电源管理:NBM7100A与STM32的优化方案

1. 项目背景与核心挑战在物联网设备和便携式医疗设备领域,不可充电的初级电池(如锂亚硫酰氯电池)因其高能量密度和长保质期成为首选电源方案。但这类电池存在一个致命缺陷:当负载设备出现瞬时大电流需求时,电池内阻会引…

2026/7/27 9:04:58

PDF合并与动态水印的工程化方案:2026国内免费工具实测对比

一、背景与测试方案 在实际项目交付中,PDF文件合并与版权保护水印的叠加是一个高频但容易被低估的技术需求。典型的处理链路涉及:多源PDF的文件流合并、页面级水印渲染(含透明度混合与图层叠加)、输出文件体积控制。看似简单的操作…

2026/7/28 0:03:34

学术论文研究创新点梳理与核心价值提炼指南

本科毕业论文是大学四年最大的坎。开题报告憋一周写不出三页,找文献翻遍十几个网站还是缺关键资料,写正文卡壳半天憋不出一句话,降重改到凌晨三点结果逻辑全乱,答辩前一天PPT还没做完。别慌,亲测这四个工具能让你少熬半…

2026/7/28 0:03:34

开发商售楼处数字化升级怎么做?

房企的数字化转型投入正在快速增长,据行业数据显示,2025年房企数字化投入规模已突破800亿元,年复合增长率达35%。售楼处的数字化升级不是单一环节的改造,而是从“获客-展示-成交-服务”全链路的系统升级。数字化升级四步法第一步&…

2026/7/28 0:03:34

模型不再值钱之后,AI 编程工具在争什么

2026 年 7 月,AI 编程工具赛道发生了一个标志性转折:模型本身不再值钱了。当 Kimi K3 开源模型在编程基准上击败 GPT 和 Claude,当 GitHub Copilot 第一次把开源模型纳入选择器,当 OpenAI 把 Codex 并入 ChatGPT 做成三合一超级应…

2026/7/28 4:38:09

3个高效策略:快速掌握Axure中文界面配置

3个高效策略:快速掌握Axure中文界面配置 【免费下载链接】axure-cn Chinese language file for Axure RP. Axure RP 简体中文语言包。支持 Axure 11、10、9。不定期更新。 项目地址: https://gitcode.com/gh_mirrors/ax/axure-cn 还在为Axure RP的英文界面感…