发布时间:2026/8/5 5:16:57
爆火的腾讯WorkBuddy发了篇论文,公开了自家底牌 今天分享一篇腾讯WorkBuddy团队最新发表的论文他们给自己造的内部尺子现在把它开源了。这篇论文不是孤立的学术工作而是 WorkBuddy 产品工程的副产品——把内部的模型选型评测、Harness 回归测试、任务分布洞察打包成一个开源 Benchmark。腾讯把多模型 Agent 工作台的选型底牌摊开了——GLM-5.2 在安全域双杀闭源模型、GPT-5.5 最省 token、Claude Opus 综合最强这些数据直接解释了 WorkBuddy 为什么要做多模型切换而不是绑定混元。提速500倍29s学会一个新Skill清华和自变量开源HOST框架一、WorkBuddy优势WorkBuddy Bench 优点任务分布对齐真实工作distribution-informed但完全开源可审计。Figure 1: Tencent WorkBuddy Bench 总览四个子集各有独立的评分仪器分数跨赛道不可比套件刻意不报总平均分——这是设计决策不是缺陷。表1套件一览四个子集双 Harness 评分二、核心方法论抗污染来自真实业务论文把提示词可被搜索引擎找到视为最重要的污染路径然后在任务生产环节就把它堵死表2开源清单——运行、评分、审计一个任务所需的一切全部公开任务来源每个任务锚定一个真实上游工件开源仓库的历史 commit / PR、真实 CVE或具体业务场景。匹配的不是原始请求本身而是内部使用分布查询意图类别、请求结构模式——任何原始用户 prompt、会话数据都不进入任务。改写协议逆向工程后改写成简短、口语化、刻意欠规格underspecified的请求。Code 赛道还通过五种角色发声开发者、算法工程师、产品经理、QA、运维。刻意欠规格请求只给意图和约束不给目标文件、接口定义、边界情况——Agent 必须自己从工作区里找回缺失的上下文。这考的是需求消歧与 grounding而不只是代码合成。赛后评测隔离评分资产在 Agent 行动期间完全不可见结束后才注入沙箱。“Hidden tests”指的是解题时不可见而非发布后保密——全部测试随开源一起放出。三、四大赛道拆解3.1 Code80 个任务里只有 10 个是修 BugCode 子集把 Agent 扔进一个 checkout 到基线 commit 的完整开源仓库要求它自己定位代码、改完、并保证隐藏测试通过。和 SWE-bench 最大的不同是角色与任务类型多样性五种角色、18 个细分类目Bug 修复只占 10/80。Figure 2: Code 与 Web 任务构成表3Code 子集来源家族A34BC46表4Code 子集构成80 任务开源版准入门机制值得一提每个候选任务先对未改动的工作区跑一遍验证器baseline reward 必须 ≤ 0.3证明任务不是”白给”再打上 gold patch 跑一遍oracle reward 必须 1.0证明任务可解。构建期的早期评测还暴露了两类零分模式Agent 陷入改测试文件的死循环直到超时在大仓库里迷路、改了完全不相干的文件——难度来自导航与定位而非代码合成。Figure 3: Code 任务与评测工作流3.2 Web交付物契约——说得再好路径下没有可运行工件就是零分Web 子集的硬核设定是artifact-not-chat 契约Agent 必须在声明的输出路径产出可运行工件如 HTML 入口聊天里写得天花乱坠但路径下没东西直接挂。70 个任务横跨生成、修改、分析、质检四类前端工作。Figure 4: Web 任务与评测工作流3.3 Office评的是最终工作区状态不是答案文本Office 子集测的是混合格式文件表格、文档、PDF、JSON、Markdown、文件树里的完整工作交接。评测盯的是最终工作区状态——写了一份看似合理的总结却没更新它描述的那张工作簿照样丢分这是纯文本评分抓不到的失败。Figure 5: Office 50 任务的构建路线与校准难度Figure 6: Office 四维覆盖评分是双通道确定性 Rule checks 验证文件、schema、数值、跨文件关系、状态变更、副作用边界LLM Judge 基于任务结束后生成的固定证据评估二元语义 rubric不看实时工作区、也不能改写 Rule 结果。每个任务预配自己的 Rule 权重 w_i ∈ [0.70, 0.95]。Figure 7: Office 评测流3.4 Security60 个任务全程无 LLM 裁判 五层反作弊Security 子集覆盖红蓝队全景漏洞发现与安全利用32红、恶意软件分析14蓝、安全运营8蓝、Agent 安全6红——38 红 vs 22 蓝难度刻意偏硬。Figure 8: Security 子集总览白盒审计任务复现 binutils、curl、nginx、vim、jq、fluent-bit 等广泛部署项目的真实历史 CVE采用 find-vuln → poc-verify 两步结构先读源码定位漏洞路径过阈值才解锁第二步再提交能在沙箱里稳定触发 ASAN crash 的 PoC。表5Security 子集构成60 任务四块粒度四、榜单结果没有全能冠军Harness 一换排名就洗牌表6WorkBuddy Bench 总榜0–100think 模式三次运行均值八块榜三分天下Opus 4.8 拿五块Code 双榜、Web 双榜、Office cbcGLM-5.2 以开源权重身份拿下 Security 双榜——开源与闭源的差距是分板块的不是均匀碾压GPT-5.5 拿 Office cc 一块。Harness 敏感性的几个爆点Code 排名在双 Harness 间直接换位GPT-5.5 在 cbc 下领先 GLM-5.272.90 vs 71.54在 cc 下被反超76.63 vs 77.06。Security 洗牌最狠七模型平均绝对位移 8.6 分GPT-5.5 从 cbc 第六蹿到 cc 第二MiniMax-M3 从第二跌到第五。Office 最稳七个双跑模型里五个位移不到 2 分中位数 0.86。工程细节能值 4 分HY-3 开启跨轮 reasoning passback 后 Code 分数 cbc 3.82、cc 1.92。拒答也值得记录Opus 4.8 在 Claude Code 下对安全任务出现 13 次任务级拒答cbc 下为零GPT-5.5 在 cbc 下 2 次。最难的类目暴露了真问题Code 子集里最难的是 bug_fix均值 0.47和 api_contract0.47——真实仓库的回归修复和严守契约的接口活最易的是 feature_pipeline0.94和 testing0.88。product_analytics 类目模型间差距几乎拉满 0–1.0 全程高分模型会正确推断”别把隔很久才买的算进来”这个隐含归因窗口低分模型代码跑得干干净净但把全部购买都算了进去——差距完全在业务语义理解不在代码能不能跑。另一个典型失败是”语义对但契约错”行为合理却丢了一两个必需字段如 OpenAPI 的 deprecated、examples验证器一打 per-field 布尔检查就连环清零。Figure 9: Office 按难度与任务类型的结果表7Code 子集每轮开销轮次 / 输出 token / 含缓存输入 token千为单位花钱多 ≠ 分数高DeepSeek-V4-Flash 在 cc 下输出约为 GPT-5.5 的 3.3 倍28.6k vs 8.7k分数却低 14.74 分GLM-5.2 的 cc 榜首成绩 77.06 花了 22.0k 输出 token而 GPT-5.5 只用 8.7k 拿到 76.63。GPT-5.5 是全场四赛道一致的”最省高分者”cbc 下 Code 6.9k / Web 13.5k / Office 10.2k / Security 7.5k 输出。Security 是最重的赛道30–89 轮/次MiniMax-M3 在 cbc 下平均 88.8 轮、约 11.1M 含缓存输入 token 换 74.14 分。六、与现有工作的对位表8Web 方向 Benchmark 能力矩阵∙ 全覆盖◦ 部分覆盖空白 未覆盖这些是自报的设计期对比不是跨榜单实测。差异化在于广度与框架而非新任务类型——Security 子集是公开 Benchmark 稀缺的红蓝全覆盖 全确定性评分Office 把混合格式多交付物工作流当”完整交接”来测Code 用五角色 18 类目跳出”修 issue”框架。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

2026/8/5 5:16:57

Linux网络实时监控利器nload:命令行流量分析实战指南

1. 为什么命令行流量监控依然是运维的“定心丸”在云原生和容器化大行其道的今天,各种图形化、Web化的监控面板层出不穷,PrometheusGrafana的组合几乎成了标配。但很多老运维或者深度Linux用户,依然会在终端里敲下nload这个命令。这不仅仅是一…

2026/8/5 5:16:57

OpenCode Go与GPT-5.6 Luna:构建AI代码助手的核心原理与工程实践

最近在技术社区看到不少关于“OpenCode Go 上线 GPT-5.6 Luna”的讨论,很多开发者对这个新工具既好奇又困惑。它到底是什么?是新的AI模型,还是一个集成开发工具?和之前的GPT系列有什么关系?本文将为你彻底拆解OpenCode…

2026/8/5 5:16:57

Linux双网卡配置NAT网关:十分钟实现网络共享与隔离

1. 项目缘起:一个被忽视的Linux网络“超能力”最近在折腾一台闲置的旧笔记本,想把它改造成一个轻量级的家庭服务器,跑点小服务。这台机器有两个网口,一个有线(eth0)连家里的主路由器,另一个有线…

2026/8/5 7:22:03

Xshell远程连接Linux服务器并实现图形界面X11转发完整指南

1. 项目概述:从命令行到图形界面的远程桥梁对于很多刚接触Linux服务器运维或者开发的工程师来说,一个常见的场景是:服务器部署在机房或者云端,我们通过Xshell这类强大的终端工具进行SSH连接,熟练地敲击着命令行。但当我…

2026/8/5 7:22:03

单硬盘双Win10系统安装指南:从分区规划到引导修复全解析

1. 项目概述:为什么要在单硬盘上折腾双Win10?最近帮朋友处理一台旧笔记本,他的需求很明确:机器只有一块512GB的固态硬盘,但需要同时安装两个独立的Windows 10系统。一个用于日常办公和娱乐,另一个则专门用来…

2026/8/5 7:22:03

Unity行为树插件Behavior Designer:AI开发从入门到实战

1. 项目概述:为什么是Behavior Designer?如果你在Unity里做过稍微复杂一点的AI,比如一个会巡逻、发现玩家后追击、血量低了会逃跑、还能呼叫支援的敌人,那你肯定对满屏幕的if-else、switch-case或者状态机枚举感到头疼。代码越写越…

2026/8/5 7:22:03

Oracle SQL中OR运算符的深度解析与优化实践

1. OR运算符的本质与基础用法在Oracle数据库操作中,OR是最常用的逻辑运算符之一。它的核心功能是将多个条件组合起来,只要其中任意一个条件为真,整个表达式就返回真值。这与AND运算符形成鲜明对比——AND要求所有条件都必须满足。基础语法结构…

2026/8/5 7:17:03

微服务架构下身份、任务、幂等与审计四大状态管理实战指南

1. 项目概述:从无状态核心到状态管理的十字路口最近在设计和重构一个基于微服务架构的后台系统时,我们团队遇到了一个非常经典的架构难题。我们前期花了大力气,将核心业务逻辑都设计成了无状态的,服务实例可以随意扩缩容&#xff…

2026/8/5 3:13:11

如何用免费工具突破游戏窗口限制:SRWE完整使用指南

如何用免费工具突破游戏窗口限制:SRWE完整使用指南 【免费下载链接】SRWE Simple Runtime Window Editor 项目地址: https://gitcode.com/gh_mirrors/sr/SRWE 你是否遇到过这样的困扰?想为心爱的游戏截图,却发现游戏不支持自定义分辨率…

2026/8/5 0:01:34

三升四,比成绩下滑更可怕的,是孩子开始「认命」

分水岭上,最难的不是翻过去,是孩子不想翻了。八月初了。这两个字,对三升四的家长来说,比任何闹钟都让人清醒。最近的家长群里,气氛明显不一样了。一升二的在关心兴趣班,二升三的在讨论要不要提前学英语。而…

2026/8/5 0:01:34

Java缓存框架:JetCache

TOC 一、简介 JetCache 是一个 Java 缓存抽象框架,为不同的缓存解决方案提供了统一的使用方式。 它提供的注解比 Spring Cache 更加强大。 JetCache 的注解支持原生 TTL、两级缓存以及在分布式环境中的自动刷新功能,同时你也可以通过代码直接操作 Cach…

2026/8/5 0:01:34

AD 铺铜设置十字连接,过孔全连接,新版AD的简单设置

需求:通孔焊盘 十字花;过孔 Via 实心直连;贴片焊盘按需设置 AD 测试版本AD24 很多工程师踩坑:全部统一十字,导致接地过孔阻抗高、大电流发热! 一、快捷键打开规则 PCB 界面按下:D R 展开…

2026/8/3 22:40:58

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/3 13:26:41

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/3 16:43:13

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…