为什么Harness比模型更重要:Ante在Terminal-Bench 2.1上公开评测82.7%的方法论

发布时间:2026/10/8 18:17:26

为什么Harness比模型更重要:Ante在Terminal-Bench 2.1上公开评测82.7%的方法论 为什么Harness比模型更重要Ante在Terminal-Bench 2.1上公开评测82.7%的方法论【免费下载链接】ante-previewGhost in your shell. Ante is a self-contained agent harness with a highly optimized core. It works like Claude Code or Codex, with none of their dependencies or model constraints.项目地址: https://gitcode.com/gh_mirrors/an/ante-previewAnte 是一个自包含的终端智能体Agent Harness像 Claude Code 一样在 Shell 中替你干活但它评测的不是某个英雄模型而是Harness 本身的调度能力——在 Terminal-Bench 2.1 官方约束下Ante 的公开全量评测达到 82.7%89 个任务 × 5 次试验 445 次独立运行并且这套结果完全可审计、可复现。这篇文章带你拆解这套评测方法论为什么它比晒一张跑分截图可信得多。什么是 Agent Harness为什么它比模型更值得评测大多数 AI 编程工具的演示都是这样的换上更贵的模型 → 分数涨 → 归功于模型。但 Ante 团队的立场正好相反我们评测的是Agent Harness——它如何调度模型的算力而不是模型本身。 ——docs-site/docs/benchmarks/eval.mdx打个比方模型是发动机Harness 是底盘和传动系统。同一台发动机装在调校精良的底盘上跑圈速度可以差出几秒。Terminal-Bench 2.1 考察的正是这套传动系统读上下文 → 推理 → 执行命令 → 验证结果这个循环的每一步都由 Harness 负责编排。方法论一评测你真正在分发的版本这是整套方法论里最反作弊的一条评测真实分发的构建每次评测都运行固定且公开可下载的 Ante 发行版与你ante update装到的是同一个二进制。没有评测专用分支也没有针对 Benchmark 定制的提示词。运行记录完全可审计每个分数都链接其原始 Harbor 运行记录任何人都能审查 445 次试验中每一次的完整过程。沙箱内真实安装测试适配器 ante-harbor/ante_agent.py 在隔离沙箱内通过官方安装脚本装好 Ante再执行--yolo --output-format json --no-skills等最小化参数运行——评测环境与用户环境一致而不是实验室特供版。换句话说你下载跑的那个二进制就是打榜的那个二进制。分数和交付物零漂移。方法论二89个任务×5次试验 445次可审计运行Ante 遵循 Terminal-Bench 官方排行榜的完整约束约束项设定任务集89 个终端任务Terminal-Bench 2.1每任务试验数5 次总试验数445 次独立运行超时与硬件与官方榜单严格一致的超时和硬件上限执行环境Harbor 隔离沙箱每次运行从零开始5 次试验的设计是为了对抗运气分——单次跑出的高分可能是蒙的5 次取平均才能看出真实水平。这也解释了为什么结果会标注误差范围例如 GLM 5.2 的74.6% ±2.06。Ante 并非第一次上榜Terminal Bench 1.02025公开榜第一Terminal Bench 2.0 验证智能体第一。连续三届榜单的成绩本身就是Harness 能力持续进化的最好证据。方法论三统一 Harness跑遍所有模型Ante 最激进的方法论设计是不发布一个英雄分数而是发布一组跨模型分数。实时看板截至 2026 年 6 月的关键数据模型准确率同模型排名DeepSeek V4.1 Flash83.9%#1GLM 5.274.6% ±2.06#1MiMo V2.565.8% ±2.30#1DeepSeek V4 Pro65.8% ±2.25#1DeepSeek V4 Flash62.7% ±2.29#1MiniMax M362.1% ±2.33#1两个值得注意的事实Ante DeepSeek V4.1 Flash 达到 83.9%370/445 次成功全量 445 次试验的推理总成本仅约 $18Ante GLM 5.2 达到 74.6%让一个开源权重模型跻身公开验证榜单的第一梯队这说明什么一个优秀的 Harness 能把前沿能力下放让中端开源模型完成以往只有昂贵旗舰模型才能胜任的工作。同模型第一#1 same-model的判定口径也很严格——在同一个模型下没有任何其他 Harness 跑出比 Ante 更高的分数。优化 Harness而不是调 PromptAnte 的评测原则里有一句非常清醒的话Improve the harness, not the prompt.如果分数提升是因为系统真的变好了那提升会保持住如果是因为调了一条 Prompt那就是脆弱的。对比一下两种提分路径路径做法结果❌ 调 Prompt针对特定 Benchmark 定制提示词分数上涨换个任务就塌✅ 改 Harness改进运行时、编排、可靠性ante-acp/src/session.rs、ante-acp/src/turn.rs 背后的会话/回合循环分数上涨且持续有效这套哲学的落地就是早开始、保持简单、隔离可复现从小而诚实的失败案例集开始每次评测都从干净环境启动——分数下跌就意味着真实回归不存在环境脏了这种借口。轻量也是实力Docker 实测 7 倍内存优势Harness 的另一个隐藏维度是资源足迹。Ante 团队在 Docker 中用相同约束跑了 20 个并行任务实测 CPU / 内存 / 磁盘指标AnteClaude CodeOpencode峰值内存1.9 GB13.9 GB12.9 GB平均 CPU1.3%12.1%3.8%磁盘总 I/O2.8 GB32.6 GB33.7 GBAnte 的峰值内存约为 Claude Code 的 1/7平均 CPU 约 1/9。对单个用户感知不强但当 Harness 轻到可以同时跑上万个实例时这份轻量就是经济账。完整数据见 docs-site/docs/benchmarks/compare_table.md。客户端/守护进程分离的架构见上图文档源 docs-site/docs/reference/architecture.mdx让 TUI、无头 CLI、ante serve前端共享同一个引擎——这也保证了无论哪种入口被测的 Harness 内核都是同一份代码。如何复现这套评测方法论的价值在于可复现。整个评测链路都由仓库内的 ante-harbor/ 目录承载适配器ante-harbor/ante_agent.py 把 Ante 接进 Harbor 测试框架ante-harbor/ante_events.py 负责把 Ante 的结构化事件流翻译成用量、步骤数、失败分类等审计元数据样本数据ante-harbor/fixtures/ 提供真实运行切片方便调试适配器执行方式harbor run --agent ante_agent:AnteAgent --dataset terminal-bench2.0 --n-attempts 5模型、Provider、推理力度均可参数化注入结果发布每次全量运行锁定具体版本号如0.preview.98原始 Harbor 运行记录公开可查结语回到标题的问题为什么 Harness 比模型更重要因为模型是公共资源人人都能接而 Harness 是私有工程决定了模型能力的损耗率。Ante 用 89×5445 次可审计运行证明了三点✅诚实——评的就是你装的那个二进制✅公平——官方约束、跨模型横评、同模型第一✅可持续——改底盘而非改提示词分数只涨不塌如果你想在自己的终端里体验这套 Harness安装入口见 README.md核心执行原语在 crates/exec/协议定义在 crates/protocol-shape/。想要一个只保留 4 个工具的极简形态复制 curated/pi.settings.json 再执行ante --profile pi即可——同一个二进制任意一种智能体这正是One Harness的全部含义。【免费下载链接】ante-previewGhost in your shell. Ante is a self-contained agent harness with a highly optimized core. It works like Claude Code or Codex, with none of their dependencies or model constraints.项目地址: https://gitcode.com/gh_mirrors/an/ante-preview创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/10/8 18:17:26

e2e遥测模块源码解析:PostHog事件与字段清单完全指南

e2e遥测模块源码解析:PostHog事件与字段清单完全指南 【免费下载链接】e2e Next generation e2e testing framework for web and mobile apps. 项目地址: https://gitcode.com/GitHub_Trending/e2e6/e2e e2e 是一款面向 Web 和移动端应用的下一代端到端测试框…

2026/10/8 18:17:26

Skills不是长Prompt:AI助手技能封装的原理与实战

上周有个同事拿着他刚调好的"AI 周报机器人"来找我,说模型动不动就把三条记录合并成一句废话,问我是不是 prompt 写得太短。我打开他所谓的 skill 看了一眼:没有目录结构,触发描述一团浆糊,所有逻辑全堆在提…

2026/10/8 22:08:44

Python字典详解:从哈希表原理到实战应用

接触Python这么久,我越来越觉得字典(Dictionaries)是这个语言里最被低估的数据结构。列表负责有序地装东西,元组负责不可变地保护东西,而字典负责高效地“按名字找人”。如果列表是一个一个排好队的柜子,字…

2026/10/8 22:08:44

SteamOS要兼容安卓应用:兼容层路线的技术账

据海外科技媒体 Ars Technica 披露,在现有的 Proton 兼容层之外,Valve 给 SteamOS 又加了两个兼容层:面向 Arm 硬件的 FEX,以及用来运行安卓应用的 Lepton。简单说,Valve 想让一台基于 Linux 的掌机,既能跑…

2026/10/8 22:08:44

GPT Image 2 提示词库:把散落的生图提示词变成工程资产

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 22:03:42

VS Code前端常用插件:把settings.json改到TaoToken统一Key通道

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 10:03:18

Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化

1. 从“Jev”说起:为什么我要把Agent接进浏览器“Jev”这个词最近在圈子里出现的频率越来越高,很多人第一次听到会以为是某个新模型的名字,其实它更像是一种思路——把Jev模型的能力当作底座,通过Agent的方式去接管浏览器&#xf…

2026/10/8 10:03:20

多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系

1. 从"单兵作战"到"集群协同":多智能体编排到底在解决什么问题如果你最近在折腾 Agent 相关的东西,大概率会有一种感觉:单个 Agent 能做的事情,其实很快就摸到天花板了。你给它一个提示词,挂几个工…

2026/10/8 6:05:44

无源低通滤波器设计实战:从RC到LC,手把手教你避开那些坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 0:02:17

自然数立方等于连续奇数之和:从证明到编程验证

十几年来我一直游走在数学科普和编程教学这两块内容之间,对“看起来像魔法、拆开全是数学”的结论总是格外敏感。最近翻资料时又撞见一句话:任何一个自然数 m 的立方,都可以写成 m 个连续奇数之和。2 的立方等于 3 加 5,3 的立方等…

2026/10/8 0:02:17

C#上位机SSH连接实战:用SSH.NET补齐超时、批量与密钥认证

简介:这是一份基于 C# 开发的 SSH 连接功能半成品工程,原本作为另一个主项目的子功能模块,现独立打包分享。工程采用 WinForms 界面,包含源码、解决方案、安装部署工程、NuGet 依赖包及说明文档,适合正在做远程连接、网…

2026/10/8 0:02:17

Java SpringBoot一体化智能售后系统设计与实现全解析

毕业设计年年做,Java Web 方向的题目翻来覆去就那么几个,但“一体化智能售后系统”这个题,每次看到我都觉得值得认真聊一聊。它不是一个简单 curd 堆出来的管理系统,而是把客户、工单、派单、处理、回访、统计整条链路串起来的一套…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑