发布时间:2026/8/21 6:18:43
光有大脑没用:大模型这五年是怎么长出身体的 文章目录光有大脑没用大模型这五年是怎么长出身体的先把话说透大模型给了什么没给什么第一代壳IDE 插件模型当输入法2021第二代壳网页聊天框模型第一次当主角2022第三代壳对话进 IDE模型长出了手2023–2024第四代壳终端 Agent循环闭合2025第五代壳Work 时代harness 泛化成操作系统2026一张表看清五代壳这条线对选工具到底有什么用回到开头光有大脑没用大模型这五年是怎么长出身体的同一个 Claude在网页聊天框里你问它这个 Bug 怎么修它给你一段代码让你自己复制回去试在 Claude Code 里你说修一下这个 Bug它自己读代码库、改文件、跑测试、看报错、再改一轮最后把能跑通的提交摆在你面前。模型是同一个模型什么都没换。体验却完全是两回事。差出来的那部分东西行业现在有了统一叫法harness。Anthropic 自己的说法很直白——“Claude Code 就是 harnessClaude 是装在里面的模型”。LangChain 那位工程师的说法更狠“如果你不是模型那你就是 harness。”这篇文章就讲一件事大模型是怎么让 Agent 会干活的——答案从来不是把模型做大而是围绕这个大脑一层一层地给它装身体。网页聊天框、IDE 插件、终端工具、今天的 Work 类产品表面上是界面换了五代内核是同一个模型外面的壳越装越厚。看懂这条线你就知道现在这波 AI 产品到底在竞争什么。先把话说透大模型给了什么没给什么大语言模型本质上是个无状态的文本函数文本进文本出。两次调用之间什么都不记得不能读你的文件不能跑你的命令更不能改变外部世界的任何东西。它能想但既不能做也不能记住。所以让模型会干活落到实处就是在外面补三样东西上下文每次调用时喂给它什么。光标前的几行代码是一个喂法整个代码库是另一个喂法。工具它吐出的意图谁来执行。只能输出文本是一回事能触发真实的文件读写、命令执行是另一回事。循环它能不能多跑几步。回答一句就停和干到完成为止是两种完全不同的产品。这三样东西加起来加上沙箱、记忆、权限控制、错误处理这些工程件就是 harness。2026 年 Hugging Face 的 Agent 术语表把这个关系写成了公式Agent Model Harness。模型决定上限harness 决定这个上限能不能兑现成你手里的成果。有意思的是时间线。很多人以为顺序是先有 ChatGPT 聊天框再有 IDE 插件其实反了——第一波规模化落地的大模型产品是 IDE 补全插件比 ChatGPT 早了一年半。下面按真实顺序讲这五代壳。第一代壳IDE 插件模型当输入法20212021 年 6 月GitHub Copilot 开始技术预览。它做的事情今天看起来原始看你光标前面的代码猜你接下来要写什么按 Tab 接受。从赋能的角度看这一代壳只给了一样东西上下文而且只有当前文件里的一小段。没有工具——模型输出直接变成你编辑器里的文字除此之外碰不到任何东西没有循环——它每次只猜一步猜完就停。这时候的模型角色说难听点是个更聪明的输入法。开发者社区当时对它的评价两极一半人觉得是玩具另一半人默默发现自己的 Tab 键开始干越来越多的活。GitHub 后来给出的数据是它能生成约 40% 的代码但都是短片段一旦涉及跨文件逻辑就开始胡说。但这一代壳确立了一个重要事实模型可以直接嵌进你的工作界面而不是站在旁边等你去问。这个方向一旦被验证后面的一切都是它的延伸。第二代壳网页聊天框模型第一次当主角20222022 年 11 月 30 日ChatGPT 上线。两个月破一亿用户把和大模型对话变成了全民动作。聊天框给模型的东西是多轮循环——你可以追问、纠正、让它换个思路重来。这在当时的网页产品里已经是质变。但聊天框有个致命的先天缺陷没有工具也没有你的上下文。于是 2023 年上半年出现了一个现在回想很荒诞的工种代码搬运工。开发者在浏览器和 IDE 之间来回切换把报错贴给 ChatGPT把生成的代码复制回编辑器跑挂了再把报错贴回去。模型明明知道怎么修但它的手被聊天框铐住了——只能输出文本执行全靠你。这段时间模型是顾问能力强但你得亲自当它的手和腿。所有人都感觉到了这层摩擦也都想到了同一个解法把对话搬进它该在的地方去。第三代壳对话进 IDE模型长出了手2023–20242023 年 3 月Cursor 发布。它的思路不是给 VS Code 加个插件而是直接 fork 了 VS Code把 AI 做成编辑器的原生能力。同一时期 Copilot Chat 上线各家 IDE 插件全面转向对话形态。这一代壳的关键变化有两个。上下文从当前文件升级为整个代码库。你可以选中一个函数说把它重构成 async它知道哪些文件会被牵连。Cursor 真正的创新不是模型更好而是上下文模型的改变——喂给模型的不再是一行光标前文而是你的整个项目。模型有了手。2023 年 6 月OpenAI 开放 function calling模型第一次能稳定输出结构化的工具调用——不再是一段需要人肉解析的文字而是我要调哪个工具、参数是什么的明确指令。外围系统解析这个指令、真正执行、把结果喂回去闭环就成立了。这一步被讨论得太少了。聊天框时代模型只有嘴function calling 之后它有了手。从此能不能干活不再是能力问题而是工程问题。不过这一代壳还有个限制每个动作仍然是人发起的。你说一句它做一次像一个非常听话但绝不主动的结对程序员。把人发起每一步这个限制拆掉就是下一代的事了。第四代壳终端 Agent循环闭合20252025 年 2 月Claude Code 以研究预览版出现5 月正式 GA。它不在 IDE 里就在终端里而你给它的不再是改这个函数而是把这个 Bug 修了。它拿到任务后自己规划先搜代码定位问题改文件跑测试读报错判断是自己的问题还是环境的问题再改再跑——直到测试通过。循环闭合了。人的角色从指挥每一步变成最后审查结果从写代码的人变成审代码的人。也正是在这个阶段harness这个词被 Anthropic 明确写进了文档Claude Code 是围绕 Claude 的 Agent harness。整个执行机器——工具注册表、上下文管理、停止条件、错误恢复——被承认为和模型同等重要的产品本体。同一个时期OpenAI 的 Codex、Google 的 Gemini CLI、开源的 Aider 都长成了类似形态。到 2026 年初Claude Code 已贡献约 4% 的公共 GitHub 提交。开发者用钱包投票的结果说明一旦循环闭合价值量级和帮你补全代码完全不是一回事。但注意这一切还发生在终端里用户还是开发者。下一代壳要回答的问题是这套东西能不能给不懂命令行的人用能不能干编程之外的活。第五代壳Work 时代harness 泛化成操作系统20262026 年答案集中出现。OpenAI 把 Codex 并进 ChatGPT WorkAnthropic 推出 Claude Cowork国内腾讯 WorkBuddy、阿里千问办公、字节 TRAE Work、月之暗面 Kimi Work 陆续上桌这几家的具体差异我之前专门写过一篇对比这里不展开。【从 Coding 到 Working国产 Work 系 Agent 和海外 Codex、Claude Cowork 有什么不同】这一代壳的本质是把终端里验证过的那套 harness——循环、工具、记忆、沙箱——搬进图形界面再把执行边界从代码库扩到整个工作流。具体到一个非开发者的日常你跟它说把上周的会议记录整理成周报数据部分对着销售表格重新算一遍下午三点前发到工作群它自己拆任务、开文件、跑分析、改格式、发出去——这一整条链路过去得你自己点几十下。支撑这种体验的是背后几件事MCP 协议把接一个工具从重写代码变成配个服务公开 server 已经破万技能包和团队级 Skill 让别人的工作流能直接被你复用用一次就能沉淀下来子 Agent 可以并行长链路任务拆开跑沙箱隔离、高危操作确认、审计日志把放它自己跑的风险按住。看一组数就懂了Codex 上非开发者的增长速度是开发者的三倍以上Claude Cowork 的数据里超过 90% 的任务和软件开发无关业务运营占三分之一编程只占不到 9%。也就是说harness 这个东西的适用范围早就超过了它被发明出来的场景。代码只是第一个被 AI 拿下的工作流因为它的验证标准最清晰——测试跑不跑得过一目了然。现在同样的机器被搬去处理报表、文档、数据分析验收这件事变难了但结构没变。一张表看清五代壳阶段代表产品模型角色harness 给了什么人的角色2021 IDE 补全Copilot输入法上下文当前文件操作者逐行写2022 聊天框ChatGPT顾问多轮对话无工具搬运工复制粘贴2023–24 对话进 IDECursor、Copilot Chat结对助手全库上下文 工具调用指挥者逐次发起2025 终端 AgentClaude Code、Codex CLI执行者闭合循环 记忆 自纠错审查者验收结果2026 WorkCowork、WorkBuddy 等干活的同事MCP 技能 子 Agent 沙箱验收者定目标壳每厚一层模型离事情本身就近一步人离具体操作就远一步。而模型始终是那个无状态的文本函数——从 Copilot 到 Cowork它被调用的方式没有本质变化变化的全是外围。这条线对选工具到底有什么用一是别只盯模型参数。Hugging Face 那篇术语表里有个判断很到位两个用同一个底层模型的产品体验可能完全不同因为它们的 harness 做了不同的选择——上下文怎么组装、工具给哪些、什么时候停、错了怎么恢复。反过来给同一个 harness 换个更强的模型体验也会变。模型、harness、产品是三样不同的东西选工具时值得分开评估。二是别小看 harness 工程本身。大家的注意力都在模型军备竞赛上但 LangChain 有个被广泛引用的案例模型和权重都不动只改外围基础设施TerminalBench 排名从 30 名开外冲到第 5。还有研究项目让 LLM 自己去优化这些基础设施跑出了 76.4% 的通过率超过人类工程师手工设计的系统。模型之外的一切正在从胶水代码变成一门正经的工程学科。三是别神化这套东西。循环闭合意味着误差也会累积——每步 1% 的出错率二十步下来就剩八成把握。所以每一代壳都在同步加厚另一半测试、校验、人工确认、审计。harness 不只是让模型能干活的机器也是让它的错误不至于失控的缰绳。这个词本身的意思就是马具——既能驱动也要受控。回到开头回到开头的问题同一个大模型为什么换个壳就会干活了因为这件事从来不是发生在模型内部而是发生在模型外面。这五年大模型的聪明程度当然在涨但真正把会聊天的模型变成会干活的系统的是那层不断加厚的壳——从一段上下文到一双能调工具的手到一个能自纠错的循环再到今天连接整个工作流的运行时。大脑一直都在。五年时间行业做的事情是给它造身体。下一个五年的问题大概是身体造好之后人和它的分工怎么重新划——目前看趋势已经写在表里了你负责说要什么它负责做完你们共同负责验收。你现在的工作流停在第几代壳上

相关新闻

2026/8/21 7:18:46

KNN算法实现手写数字识别:从原理到实践完整指南

这次我们来看一个经典的机器学习入门项目:基于 KNN 算法的手写数字识别。对于很多刚接触机器学习的朋友来说,MNIST 数据集和 KNN 算法往往是第一个实战案例。这个项目的重点不在于算法有多复杂,而在于它能否清晰地展示从数据加载、模型训练到…

2026/8/21 7:18:46

东京GSD本社招聘解析:双轨制雇佣与顶级福利

1. 项目概述:东京GSD本社招聘解析最近在整理东京地区的优质职场机会时,GSD本社的招聘信息引起了我的注意。这家公司以"正社员与个人事业主双轨制"为特色,在福利待遇方面号称行业顶级水平。作为在东京职场摸爬滚打多年的从业者&…

2026/8/21 7:18:46

非拟线性偏好下的拍卖机制设计:兼顾公平与效率的算法实践

1. 项目概述:当拍卖遇上“非钱”的偏好拍卖,一个听起来充满金钱气息的词汇,通常我们想到的是拍卖师落槌、买家举牌、价高者得的场景。在这个经典模型里,大家有一个心照不宣的假设:所有竞拍者都是“理性经济人”&#x…

2026/8/21 7:18:46

AI率太高应该从哪儿改?按报告定位才能真正降低论文AI痕迹。

AI率太高应该从哪儿改?按报告定位才能真正降低论文AI痕迹。 你可能正遇到这种情况:检测处理结果中摘要、综述和结论标记程度不同,你却一直从第一页顺序换词。真正的问题不是“有没有一键按钮”,而是没有把查重、AIGC检测、文本改写…

2026/8/21 7:13:46

从固定流程到反思型智能体:构建可控信息抽取系统的架构与实践

1. 项目概述:从固定流程到反思型智能体的跨越最近在做一个信息抽取的项目,感触很深。过去我们做信息抽取,无论是用规则、模板还是传统的机器学习模型,本质上都是在构建一个“固定流程”。你定义好实体类型、关系模式,模…

2026/8/20 10:17:13

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/20 20:11:18

工业传感器与变送器详解:序章 从物理世界到工业数据

序章 从物理世界到工业数据 ——重新认识工业传感器与变送器 工业自动化系统正变得日益复杂。今天的工业现场早已不是简单的控制回路,而是由多层技术共同构成的立体体系:PLC、DCS、SCADA、MES、工业互联网、边缘计算与人工智能。控制系统可以执行复杂算法,工业网络可以实现…

2026/8/21 0:03:13

Linux命令-uucico(UUCP传输程序)

Linux命令-uucico(UUCP传输程序) 🔰简介UUCP 体系简介 📖语法⚙️选项配置文件 💡示例示例 1:基本传输操作示例 2:主模式与从模式示例 3:调试与故障排查示例 4:UUCP 配置…

2026/8/21 0:03:13

Linux命令-uupick(UUCP文件接收工具)

Linux命令-uupick(UUCP文件接收工具)🔰简介uupick 在 UUCP 传输链中的位置📖语法⚙️选项交互命令💡示例示例 1:基本接收操作示例 2:仅处理来自特定系统的文件示例 3:完整 UUCP 文件…

2026/8/20 8:35:23

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/20 9:15:29

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/21 0:31:27

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…