发布时间:2026/7/30 3:52:11
微软一天连发3篇之:打造自己的Harness原生Agents 就在前几天抱抱脸 Daily Papers 上微软一口气挂出三篇论文——《LLMs Get Lost in Evolving User Intent》《Multi-Turn On-Policy Distillation with Prefix Replay》以及本篇主角OpenForge RL。[HarnessModel双引擎驱动的长程Agents最新综述]现在的 Agent 都跑在Claude Code、Codex、OpenClaw这类复杂 Harness 里但开源 SFT/RL 框架根本塞不进这些 Harness 去训练只能重新实现一个简化版OpenForge RL用一个轻量代理Proxy Kubernetes 编排器让任意 Harness × 任意环境都能直接接入标准 RL 代码库只用几百到几千个任务就把30B-A3B 和 8B模型训到了同尺寸开源模型的最前面。一、训练时一套脚手架部署时另一套今天的顶尖 Agent 早就不是”裸模型”了。它们被包裹在越来越复杂的推理 Harness里——Claude Code、Codex、OpenClaw 这些编排脚手架负责多轮交互、工具调用、上下文管理还连着 MCP Server、浏览器、GUI 等外部系统。论文直言近期 Agent 基准上的进步Harness 的功劳不亚于基座模型本身。Figure 1左——OpenForge RL 基于 Orchard Env把任意 Harness × 任意环境接入 veRL 等标准 RL 代码库消除训练-部署错配右——OpenForge 训练的模型在 6 种 Harness、6 个 Claw/GUI 环境上评测但问题来了开源社区想端到端改进这些 Agent面临两堵墙Harness 把推理变成了有状态、多进程的过程——嵌套工具调用、子 Agent、长程上下文开源训练栈veRL、slime 等原生表达不了。大家只能在训练时重新实现一个”简化版 Harness”于是产生train–deploy mismatch训练-部署错配。Harness rollout 需要容器化环境大量 CPU/内存无法和训练节点共置而大多数开源 RL 框架默认 rollout 在 trainer 本地跑。二、OpenForge RL 怎么做的Proxy 拦截 K8s 远程沙箱OpenForge RL 的核心思路是把训练和推理解耦靠两个轻量组件Figure 2OpenForge RL 架构总览轻量 Proxy包在推理服务器如 vLLM外面拦截 Harness 发出的所有模型调用路由给 RL 框架的推理引擎同时把每一对 prompt-responseio-pair记录为训练轨迹。rollout 结束后Proxy 收集终端奖励 把轨迹重构成标准样本 其中 通常 。重构出来的是标准 RL 样本格式所以后端用 GRPO、PPO 还是 REINFORCE 都行Harness 内部怎么折腾训练器完全不用管。Kubernetes 编排器基于 Orchard每个 rollout 在云上Microsoft Azure起一个独立远程容器弹性伸缩支持任意并发环境。三、数据从哪来五阶段自动合成流水线代码之外的第二个贡献是一条任务/环境自动合成流水线。原因很简单浏览器操作、桌面操作这些领域不像编程公开可用的 RL-ready 任务和环境少得可怜。流水线搭建在 Claude Agent SDK 上各模块由 Opus 4.6 驱动模仿人类策展任务的过程五个阶段Figure 3数据/任务合成流水线总览。Propose提案基于真实场景的参考资产池起草候选指令Claw 领域用 ClawHub 技能 ZClawBench 任务Computer-Use 用 X 搜索 API AgentNet 2.2 万条指令 Synthetic-Computer-Use 合成文件所有提案写入共享 SQLite 去重Prune剪枝从提案中挑出质量最高、最多样的 N 条Build构建为每条指令造出完整可执行环境——工具服务器、mock 网站、mock 数据、Dockerfile以及打分的 verifier 脚本Test测试让另一个开源模型Claw 用 MiniMax-M2.5Computer-Use 用 Kimi-K2.5实际跑一遍暴露环境缺陷和指令歧义Refine修复检查轨迹和 verifier 打分修补环境或改写指令循环直到通过。成本上有个务实的取舍SFT 任务的成功信号只做一次性过滤所以跳过 Test-Refine直接用 GPT-5.4 当 judgeRL 任务的 verifier 要被反复调用必须保留完整的测试-修复循环。平均下来合成一个 SFT 任务花 5.2 分钟 / 0.86 美元一个 RL 任务花 16.1 分钟 / 4.36 美元。最终的数据规模Table 1小得令人意外——几百到几千个任务ClawGUIComputerGUIBrowserHarnessReACT*、ZeroClaw、OpenClaw、CodexKimi-Agent*修改版Molmo-Web*修改版SFT 轨迹数8927951,496RL 任务数343252900Figure 4 三个领域 RL 任务的类别分布自上而下Claw、Computer-Use、Browser-Use训练配置Claw 线基座是Qwen3-30B-A3B-ThinkingSFT 从 MiniMax-M2.5 蒸馏每任务采样 3 条只留成功轨迹RL 从 SFT checkpoint 出发用 GRPObatch 8 × group 8单台 8×B200 节点GUI 线基座是Qwen3-VL-8B-ThinkingSFT 从 Kimi-K2.5 蒸馏浏览器环境用 Xvfb 虚拟显示 Browser-Use 远程浏览器服务GPT-4.1 做成功判定。四、实验结果同尺寸开源第一梯队GUI 越级打大模型4.1 Claw Agent日常工具使用在 ClawEval、QwenClawBench、MCPAtlas 三个基准上两个看点一是相对同尺寸基座14.3 → 31.7 pass³和 Qwen3-Coder 都有明显优势同尺寸~30B / 3B 激活开源模型里全面领先二是 RL 在 SFT 之上又带来一大截提升pass³ 21.7→31.7MCPAtlas 23.6→28.1证明”在真实 Harness 里在线交互学习”这件事本身有不可替代的价值——这是纯蒸馏拿不到的信号。4.2 GUI Agent8B 越级挑战8B 模型、只用 30 步对手普遍 50–100 步OSWorld-Verified 37.7 已经逼近 235B 的 Qwen3-VL38.1Online-Mind2Web 63.0 反超 Kimi K2.5 的 60.4——匹配甚至超越数倍于己的模型。Figure A1OpenForge-Claw 的 RL 训练曲线成功率稳步上升的同时轨迹在变短五、三个有意思的发现Harness 本身成了研究对象因为训练就在真实 Harness 里进行OpenForge RL 第一次让开源社区能系统地问”Harness 怎么塑造 Agent 行为”。发现一有些 Harness 天生难学同一个 OpenForge-Claw 模型在 ClawEval 上换四种 Harness 评测SFTRLpass1规律很直白能直接注册自定义工具的轻量 HarnessReACT、ZeroClaw学得最好OpenClaw 这种高度复杂、不支持自定义工具论文靠 SKILL.md 把工具暴露给它、prompt/context 还长得多的 HarnessSFTRL 的提升幅度明显更小。这给所有做 Harness 工程的人提了个醒工具和控制流不是越多越好和模型能力对齐的简单设计才是性能基础。发现二在一个 Harness 上训练能迁移到没见过的 Harness只用 ZeroClaw 训练在从未见过的 OpenClaw/Codex 上也能涨 3–5 分而混合三种 Harness 训练效果全面最好越复杂的 Harness 涨幅越大Codex 20.3连 ZeroClaw 本身都比单训更高48.5 vs 46.0。原因模型见到了更多样的工具调用语法和控制流鲁棒性随之增强。发现三RL 到底学会了什么Figure 5对比 SFT 与 SFTRL 各 100 条 ClawEval 轨迹Figure 5a ZeroClaw 下的工具使用分布。RL 把万能 shell 调用占比从 22.6% 压到 13.9%转而调用专用服务工具且轨迹略变短奖励只告诉模型”任务成没成功”从没教它用哪个工具——但 RL 自己学会了放下万能 shell、拿起专用工具。合理解释专用工具的参数 schema 和返回结构明确成功轨迹里更容易拿到 creditshell 自由度高但引号、路径、解析的错误会不断累积。Figure 5b Codex 下的行为画像雷达图SFT vs SFTRLRL 主要提升的是Agentic 可靠性自我验证写完再读回来确认、工具覆盖把任务需要的多个服务都调到、多步计划完成度。代价是步骤效率略降验证行为多花几步。最值得警惕的是错误恢复命令失败后诊断状态、另辟蹊径即使经过 RL 也只有 26 分仍是五项能力中最弱的——论文推测这类能力很难靠终端奖励的 RL 单独习得可能需要专门的数据或训练方法。附录GUI Agent 长什么样Figure A3 Computer-Use 的一个输入输出对——给定任务指令和当前截图模型单次生成推理 工具调用tool_call图中叠加了预测的归一化点击坐标Figure A4 Browser-Use 在 Online-Mind2Web 任务上的代表性一步Chromium 视口固定 1280×720坐标归一化到 [0,1]这篇论文的真正价值Harness从部署时的外围工程提升为可被训练、可被研究的一等公民Train where you deploy成为开源可选项。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

2026/7/30 4:52:14

如何三步搞定微信聊天记录永久保存:WechatBakTool终极备份指南

如何三步搞定微信聊天记录永久保存:WechatBakTool终极备份指南 【免费下载链接】WechatBakTool 基于C#的微信PC版聊天记录备份工具,提供图形界面,解密微信数据库并导出聊天记录。 项目地址: https://gitcode.com/gh_mirrors/we/WechatBakTo…

2026/7/30 4:52:14

哺乳动物细胞蛋白表达技术:载体构建与工艺优化

1. 哺乳动物细胞蛋白表达的技术背景与核心价值哺乳动物细胞表达系统已成为生物制药领域的黄金标准。与大肠杆菌、酵母等原核表达系统相比,哺乳动物细胞能够完成复杂的翻译后修饰(如糖基化、磷酸化等),使表达的重组蛋白更接近天然构…

2026/7/30 4:52:14

维修工程师的示波器实战:01 那些“测不出来”的故障,到底藏在哪里?

第一篇:那些“测不出来”的故障,到底藏在哪里? ——当你开始测量的时候,现场已经变了 凌晨的车间,控制柜前灯光昏黄。 通讯掉线、PLC报警、产线停机……故障又一次准时出现。年轻工程师深吸一口气,拿出示波器,打开柜门,接上探头,准备抓住这个“幽灵”。 然而,就在…

2026/7/30 4:52:14

C/C++字符串操作全解析:从C风格函数到std::string性能优化

1. 项目概述:为什么我们需要系统梳理字符串操作?干了这么多年C,从桌面客户端到后台服务,从嵌入式到游戏引擎,字符串处理这块“硬骨头”几乎在每个项目里都会遇到。新手时期,我也曾对着strcpy和strncpy犯迷糊…

2026/7/30 4:47:14

web 开发中 什么是代理,为什么需要代理

web 开发中 什么是代理,为什么需要代理 目录 web 开发中 什么是代理,为什么需要代理 什么是代理 为什么需要 举例 反向代理是什么 为什么需要 一句话 同源策略是什么意思 为什么要有同源策略:数据安全 为什么需要代理 还有哪些「代理」 什么是代理 代理就是中间人:请求不…

2026/7/29 22:32:30

PDF合并与动态水印的工程化方案:2026国内免费工具实测对比

一、背景与测试方案 在实际项目交付中,PDF文件合并与版权保护水印的叠加是一个高频但容易被低估的技术需求。典型的处理链路涉及:多源PDF的文件流合并、页面级水印渲染(含透明度混合与图层叠加)、输出文件体积控制。看似简单的操作…

2026/7/30 0:01:39

[GESP202606 四级] 扫雷

B4557 [GESP202606 四级] 扫雷 https://www.luogu.com.cn/problem/B4557 中国计算机学会(CCF)2026年6月C四级讲解——扫雷 https://www.bilibili.com/video/BV1MCMg6AEXR/ B4557 [GESP202606 四级] 扫雷 https://www.bilibili.com/video/BV1ZKTj6ZEVh/ 2…

2026/7/30 0:01:39

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南 【免费下载链接】DriverStoreExplorer Driver Store Explorer 项目地址: https://gitcode.com/gh_mirrors/dr/DriverStoreExplorer 您是否曾因Windows系统盘空间不足而烦恼?是否遇到过设…

2026/7/29 13:12:43

3个高效策略:快速掌握Axure中文界面配置

3个高效策略:快速掌握Axure中文界面配置 【免费下载链接】axure-cn Chinese language file for Axure RP. Axure RP 简体中文语言包。支持 Axure 11、10、9。不定期更新。 项目地址: https://gitcode.com/gh_mirrors/ax/axure-cn 还在为Axure RP的英文界面感…