微软一天连发3篇之:打造自己的Harness原生Agents

发布时间:2026/9/15 11:48:20

微软一天连发3篇之:打造自己的Harness原生Agents 就在前几天抱抱脸 Daily Papers 上微软一口气挂出三篇论文——《LLMs Get Lost in Evolving User Intent》《Multi-Turn On-Policy Distillation with Prefix Replay》以及本篇主角OpenForge RL。[HarnessModel双引擎驱动的长程Agents最新综述]现在的 Agent 都跑在Claude Code、Codex、OpenClaw这类复杂 Harness 里但开源 SFT/RL 框架根本塞不进这些 Harness 去训练只能重新实现一个简化版OpenForge RL用一个轻量代理Proxy Kubernetes 编排器让任意 Harness × 任意环境都能直接接入标准 RL 代码库只用几百到几千个任务就把30B-A3B 和 8B模型训到了同尺寸开源模型的最前面。一、训练时一套脚手架部署时另一套今天的顶尖 Agent 早就不是”裸模型”了。它们被包裹在越来越复杂的推理 Harness里——Claude Code、Codex、OpenClaw 这些编排脚手架负责多轮交互、工具调用、上下文管理还连着 MCP Server、浏览器、GUI 等外部系统。论文直言近期 Agent 基准上的进步Harness 的功劳不亚于基座模型本身。Figure 1左——OpenForge RL 基于 Orchard Env把任意 Harness × 任意环境接入 veRL 等标准 RL 代码库消除训练-部署错配右——OpenForge 训练的模型在 6 种 Harness、6 个 Claw/GUI 环境上评测但问题来了开源社区想端到端改进这些 Agent面临两堵墙Harness 把推理变成了有状态、多进程的过程——嵌套工具调用、子 Agent、长程上下文开源训练栈veRL、slime 等原生表达不了。大家只能在训练时重新实现一个”简化版 Harness”于是产生train–deploy mismatch训练-部署错配。Harness rollout 需要容器化环境大量 CPU/内存无法和训练节点共置而大多数开源 RL 框架默认 rollout 在 trainer 本地跑。二、OpenForge RL 怎么做的Proxy 拦截 K8s 远程沙箱OpenForge RL 的核心思路是把训练和推理解耦靠两个轻量组件Figure 2OpenForge RL 架构总览轻量 Proxy包在推理服务器如 vLLM外面拦截 Harness 发出的所有模型调用路由给 RL 框架的推理引擎同时把每一对 prompt-responseio-pair记录为训练轨迹。rollout 结束后Proxy 收集终端奖励 把轨迹重构成标准样本 其中 通常 。重构出来的是标准 RL 样本格式所以后端用 GRPO、PPO 还是 REINFORCE 都行Harness 内部怎么折腾训练器完全不用管。Kubernetes 编排器基于 Orchard每个 rollout 在云上Microsoft Azure起一个独立远程容器弹性伸缩支持任意并发环境。三、数据从哪来五阶段自动合成流水线代码之外的第二个贡献是一条任务/环境自动合成流水线。原因很简单浏览器操作、桌面操作这些领域不像编程公开可用的 RL-ready 任务和环境少得可怜。流水线搭建在 Claude Agent SDK 上各模块由 Opus 4.6 驱动模仿人类策展任务的过程五个阶段Figure 3数据/任务合成流水线总览。Propose提案基于真实场景的参考资产池起草候选指令Claw 领域用 ClawHub 技能 ZClawBench 任务Computer-Use 用 X 搜索 API AgentNet 2.2 万条指令 Synthetic-Computer-Use 合成文件所有提案写入共享 SQLite 去重Prune剪枝从提案中挑出质量最高、最多样的 N 条Build构建为每条指令造出完整可执行环境——工具服务器、mock 网站、mock 数据、Dockerfile以及打分的 verifier 脚本Test测试让另一个开源模型Claw 用 MiniMax-M2.5Computer-Use 用 Kimi-K2.5实际跑一遍暴露环境缺陷和指令歧义Refine修复检查轨迹和 verifier 打分修补环境或改写指令循环直到通过。成本上有个务实的取舍SFT 任务的成功信号只做一次性过滤所以跳过 Test-Refine直接用 GPT-5.4 当 judgeRL 任务的 verifier 要被反复调用必须保留完整的测试-修复循环。平均下来合成一个 SFT 任务花 5.2 分钟 / 0.86 美元一个 RL 任务花 16.1 分钟 / 4.36 美元。最终的数据规模Table 1小得令人意外——几百到几千个任务ClawGUIComputerGUIBrowserHarnessReACT*、ZeroClaw、OpenClaw、CodexKimi-Agent*修改版Molmo-Web*修改版SFT 轨迹数8927951,496RL 任务数343252900Figure 4 三个领域 RL 任务的类别分布自上而下Claw、Computer-Use、Browser-Use训练配置Claw 线基座是Qwen3-30B-A3B-ThinkingSFT 从 MiniMax-M2.5 蒸馏每任务采样 3 条只留成功轨迹RL 从 SFT checkpoint 出发用 GRPObatch 8 × group 8单台 8×B200 节点GUI 线基座是Qwen3-VL-8B-ThinkingSFT 从 Kimi-K2.5 蒸馏浏览器环境用 Xvfb 虚拟显示 Browser-Use 远程浏览器服务GPT-4.1 做成功判定。四、实验结果同尺寸开源第一梯队GUI 越级打大模型4.1 Claw Agent日常工具使用在 ClawEval、QwenClawBench、MCPAtlas 三个基准上两个看点一是相对同尺寸基座14.3 → 31.7 pass³和 Qwen3-Coder 都有明显优势同尺寸~30B / 3B 激活开源模型里全面领先二是 RL 在 SFT 之上又带来一大截提升pass³ 21.7→31.7MCPAtlas 23.6→28.1证明”在真实 Harness 里在线交互学习”这件事本身有不可替代的价值——这是纯蒸馏拿不到的信号。4.2 GUI Agent8B 越级挑战8B 模型、只用 30 步对手普遍 50–100 步OSWorld-Verified 37.7 已经逼近 235B 的 Qwen3-VL38.1Online-Mind2Web 63.0 反超 Kimi K2.5 的 60.4——匹配甚至超越数倍于己的模型。Figure A1OpenForge-Claw 的 RL 训练曲线成功率稳步上升的同时轨迹在变短五、三个有意思的发现Harness 本身成了研究对象因为训练就在真实 Harness 里进行OpenForge RL 第一次让开源社区能系统地问”Harness 怎么塑造 Agent 行为”。发现一有些 Harness 天生难学同一个 OpenForge-Claw 模型在 ClawEval 上换四种 Harness 评测SFTRLpass1规律很直白能直接注册自定义工具的轻量 HarnessReACT、ZeroClaw学得最好OpenClaw 这种高度复杂、不支持自定义工具论文靠 SKILL.md 把工具暴露给它、prompt/context 还长得多的 HarnessSFTRL 的提升幅度明显更小。这给所有做 Harness 工程的人提了个醒工具和控制流不是越多越好和模型能力对齐的简单设计才是性能基础。发现二在一个 Harness 上训练能迁移到没见过的 Harness只用 ZeroClaw 训练在从未见过的 OpenClaw/Codex 上也能涨 3–5 分而混合三种 Harness 训练效果全面最好越复杂的 Harness 涨幅越大Codex 20.3连 ZeroClaw 本身都比单训更高48.5 vs 46.0。原因模型见到了更多样的工具调用语法和控制流鲁棒性随之增强。发现三RL 到底学会了什么Figure 5对比 SFT 与 SFTRL 各 100 条 ClawEval 轨迹Figure 5a ZeroClaw 下的工具使用分布。RL 把万能 shell 调用占比从 22.6% 压到 13.9%转而调用专用服务工具且轨迹略变短奖励只告诉模型”任务成没成功”从没教它用哪个工具——但 RL 自己学会了放下万能 shell、拿起专用工具。合理解释专用工具的参数 schema 和返回结构明确成功轨迹里更容易拿到 creditshell 自由度高但引号、路径、解析的错误会不断累积。Figure 5b Codex 下的行为画像雷达图SFT vs SFTRLRL 主要提升的是Agentic 可靠性自我验证写完再读回来确认、工具覆盖把任务需要的多个服务都调到、多步计划完成度。代价是步骤效率略降验证行为多花几步。最值得警惕的是错误恢复命令失败后诊断状态、另辟蹊径即使经过 RL 也只有 26 分仍是五项能力中最弱的——论文推测这类能力很难靠终端奖励的 RL 单独习得可能需要专门的数据或训练方法。附录GUI Agent 长什么样Figure A3 Computer-Use 的一个输入输出对——给定任务指令和当前截图模型单次生成推理 工具调用tool_call图中叠加了预测的归一化点击坐标Figure A4 Browser-Use 在 Online-Mind2Web 任务上的代表性一步Chromium 视口固定 1280×720坐标归一化到 [0,1]这篇论文的真正价值Harness从部署时的外围工程提升为可被训练、可被研究的一等公民Train where you deploy成为开源可选项。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
延伸阅读

更多相关文章

2026/9/15 11:47:25

vDisk技术结合VOI/IDV架构在考场信息化中的应用

1. 考场网络部署的痛点与挑战考场信息化建设一直是教育行业数字化转型的重点场景。传统PC考场在运维管理上面临着诸多难题:考试软件安装复杂、系统镜像分发困难、终端设备维护成本高、考试环境一致性难以保障。特别是在大规模考试期间,动辄数百台终端需要…

2026/9/15 11:47:25

芯片型号命名规则解析:从字母数字看懂选型与替换关键

1. 为什么芯片型号不是一串随机字母数字,而是一本需要破译的“行业密电码”刚入行那会儿,我盯着一块ST的STM32F103C8T6开发板发呆——这串字符里,“STM”是公司缩写,“32”代表32位架构,“F”指Flash型,“1…

2026/9/15 11:42:24

2020 Linux桌面生产力应用实战指南

1. 项目概述:为什么2020年还要专门谈Linux桌面生产力应用?“10个应用程序让您的Linux桌面更具生产力”——这个标题乍看平平无奇,但放在2020年这个时间节点上,它其实是一份带着时代烙印的务实指南。那一年,统信UOS、麒…

2026/9/15 4:54:30

拯救者Y7000黑屏故障排查与维修实战指南

1. 项目概述:一台黑屏的拯救者Y7000,到底卡在哪一步? 联想拯救者Y7000系列笔记本,从2018年第一代搭载i5-8300H开始,到后来的i7-9750H、i7-10750H、i5-11400H,再到2023年款的R7-7840HS,它始终是学…

2026/9/15 0:01:16

AI英语单词APP开发:自适应学习算法与移动端优化实践

1. 项目概述 作为一名在移动应用开发领域摸爬滚打多年的老手,我最近完成了一个AI英语单词APP的开发项目。这个项目将传统单词记忆方法与现代AI技术相结合,打造了一款能够智能适应不同用户学习习惯的英语学习工具。 市面上大多数单词APP都存在一个通病&a…

2026/9/15 0:01:16

Flutter与OpenHarmony结合开发手语学习APP实战

1. 项目背景与核心价值作为一名同时接触过Flutter和OpenHarmony的开发者,最近我完成了一个基于Flutter for OpenHarmony的手语学习APP实战项目。这个项目最大的特点在于实现了跨平台框架与国产操作系统深度结合的创新实践——用Flutter开发的应用能完美运行在OpenHa…

2026/9/15 0:01:16

六个月成为机器人工程师:从ROS2到SLAM的实战路径

1. 六个月的紧迫感从哪来:先搞清楚你要成为哪种机器人工程师说实话,六个月的期限并不是一个宽松的时间线。市面上任何一本正经的机器人学教材都超过五百页,ROS2的官方文档可以翻到你怀疑人生,再加上ABB、KUKA这些工业机器人厂家动…

2026/9/14 11:59:31

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/14 13:53:59

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/15 11:42:23

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码