发布时间:2026/8/22 10:00:28
什么是Harness工程? 先说观点Agent能力并不等于模型能力。模型决定能力的上限Harness则决定任务的交付。DeepSeekHarness它其实是一个开源框架设计理念是“EverythingisaPlugin”简单理解就是上下文、工具和工作流程都可以通过插件来组合。图DeepSeekHarness开发者预览版页面为什么现在模型能力越来越强反而大家都去搞模型外边的Harness呢Harness原本是“马具、挽具”的意思。放到Agent里理解就是把模型、上下文、工具和执行环境“套”在一起。如果一定要类比它有点像Agent的操作系统。一开始我也不太相信模型外面这层东西能有多大影响。但是LangChain团队在2026年2月做过一次实验。他们固定使用GPT-5.2-Codex没有改模型权重只调整外面的系统提示、工具和中间件Terminal-Bench2.0的成绩就从52.8提升到66.5排名也从30名开外进了前5。图LangChain《ImprovingDeepAgentswithHarnessEngineering》2026年2月这组数据最让我意外的是只改模型外面的东西差距就能这么大。平时只盯着哪个模型更强很可能漏掉了真正影响任务表现的另一部分。拿“帮我做一个网页版俄罗斯方块”来说如果只是聊天模型它通常只会给我一段代码。Codex这类Agent还会进入项目目录、创建文件、启动服务然后打开浏览器看结果。这张图基本把中间的过程说清楚了图网页版俄罗斯方块任务中Model与Harness的简化分工模型会判断下一步做什么Harness就把这个判断变成操作再把报错和页面反馈送回来。模型接着改Harness再执行。它们就是这样一轮一轮往下跑。比如第一轮模型只知道我要做俄罗斯方块它会先判断应该看看当前目录。真正去扫描文件、读取内容的是Harness。目录结果回来以后模型才知道这里是一个空文件夹还是已经有了一个网页项目然后决定新建文件还是接着修改。写完也一样。模型提出要启动服务Harness去执行浏览器打不开端口报错或者页面样式跑偏这些结果再被送回来。模型本身并不直接操作我的电脑它根据当前拿到的上下文做判断再由Harness调用相应工具执行。图Codex中模型、Harness和外围能力的关系示意Skill、MCP和沙箱也都在这个循环里只是各管一块。Skill像操作手册MCP负责连接外部服务沙箱给Agent划出一个能干活的范围。Harness把这些东西接在一起。这里还有一个很容易被忽略的东西就是上下文。Agent不可能把电脑里的所有文件一股脑都塞给模型它得知道这一轮该给模型看什么是项目规则、相关代码、刚才的报错还是前面已经做过的修改。给少了模型不知道发生过什么给太多了真正有用的信息又容易被淹掉。模型明明会写为什么还是会翻车麻烦也出在这里。俄罗斯方块的代码写完了游戏却不一定真的做好了。有时Codex刚创建完HTML、CSS和JavaScript就告诉你任务已经完成可页面根本没有打开过。还有时候页面能显示但方向键没反应重新开始按钮也是坏的它仍然会说“测试通过”。模型本来有能力把游戏写出来只是Agent太早停了。Harness如果没有要求它启动项目、操作页面、对照验收标准检查它就很容易把“代码写完”当成“事情做完”。它不一定是在故意虚标。站在模型的角度文件已经生成代码看起来也完整眼前又没有新的报错它很容易判断任务到这里就结束了。问题是外面没有一道真正的完成门槛。如果Harness规定得更细情况就不一样了。页面必须成功打开方向键要实际按过分数变化和重新开始也得测试几项都通过以后才能宣布完成。反过来如果Agent围着同一个错误改了很多遍Harness也要能发现它在原地打转提醒它换办法或者停下来找用户确认。LangChain在前面的实验里也提到过类似问题Agent写完代码重新读一遍觉得看起来没问题就结束了。后来他们加入规划、构建、验证、修复的流程还增加了完成前检查效果才上去。我现在再看一个Agent已经不太会只盯着它用了什么模型了。我更关心它出错以后会不会接着改以及它说“完成”之前到底有没有真的测过。普通用户其实不用研究很多底层术语给它一个需要连续做几步的真实任务很快就能看出来。让它做网页也行让它把本地文档备份到飞书也行。中间只要碰到权限确认、跨平台调用或者执行失败就能看到它会不会把任务接着往下做最后又会不会重新读取结果确认东西确实已经交付。模型升级很容易被看见产品会直接把新模型名字写出来。Harness的变化往往藏在小地方比如出错后能不能换个办法完成以后会不会真的回头检查。单看聊天时可能感觉不明显任务稍微长一点差距就出来了。所以有人说Codex、WorkBuddy只是给大模型套了一个聊天界面我觉得不太对。聊天界面只管把话传进去、把答案显示出来Harness还要管这件事到底有没有做完。对用户来说最后看的就是这个。

相关新闻

2026/8/22 10:00:27

多流形结构分析实战:从谱聚类到深度学习的技术路线详解

1. 项目概述:从竞赛题到现实问题的跨越看到“数据的多流形结构分析”这个题目,很多人的第一反应可能是“这又是一个高深莫测的数学竞赛题”。确实,它源自全国研究生数学建模竞赛,带着浓厚的学术气息。但作为一名在数据科学和机器学…

2026/8/22 10:00:27

DeepSeek V4 Flash 快速上手与实战指南

想象一下,你正手握一把能理解你所有想法的“魔法钥匙”,却因为复杂的锁芯而迟迟无法打开那扇门——这曾是许多开发者在本地运行大语言模型时的真实写照。环境依赖像一团乱麻,权重文件散落各处,显存优化更是无从下手,往…

2026/8/22 11:15:31

HoRain云--DeeSeek Harness 防御性编程:结果报告、清理与凭据

这一篇讲五个最重要的防御性编程模式:结果报告、dispose 停稳、凭据擦除、链接删除、回调隔离。一句话:这些模式防止「一个简单的边界情况把整个 Agent 搞挂」。先看对照图下面的图把坏示例与好示例并排对比,每条都来自真实的缺陷类别。官方把…

2026/8/22 11:15:31

ChatGPT Plus订阅全攻略:从支付到稳定使用的完整路径

最近身边不少朋友都在问,怎么才能稳定、省心地用上 ChatGPT Plus 或者 Pro 版本。大家遇到的问题出奇地一致:要么是支付环节卡住,要么是订阅后不稳定,或者担心账号安全。网上信息又多又杂,各种“教程”看下来&#xff…

2026/8/22 11:15:31

山丘C版EZ模式实战:快速理解Agent工作流与安全沙盒部署

最近在技术社区里,我注意到一个很有意思的现象:很多开发者,尤其是刚接触某个新框架或工具的朋友,常常会陷入一种“我知道它很强大,但不知道它具体能帮我做什么”的困惑。这种困惑在“山丘C版”这个项目上尤为明显。你可…

2026/8/21 13:13:49

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/21 20:14:07

工业传感器与变送器详解:序章 从物理世界到工业数据

序章 从物理世界到工业数据 ——重新认识工业传感器与变送器 工业自动化系统正变得日益复杂。今天的工业现场早已不是简单的控制回路,而是由多层技术共同构成的立体体系:PLC、DCS、SCADA、MES、工业互联网、边缘计算与人工智能。控制系统可以执行复杂算法,工业网络可以实现…

2026/8/21 15:40:01

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/21 15:40:01

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/22 1:39:53

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…