清华智谱开源发布ScaleCUA:可扩展的任务合成和在线强化学习 GUI Agent框架,9B模型刷新开源SOTA

发布时间:2026/9/16 18:47:54

清华智谱开源发布ScaleCUA:可扩展的任务合成和在线强化学习 GUI Agent框架,9B模型刷新开源SOTA 一句话讲清楚清华大学与 Z.AI 提出 ScaleCUA 用 VeriGen 在真实桌面容器里规模化合成可验证 GUI 任务再配合前沿采样与视觉上下文切分把开源计算机使用智能体做到 OSWorld 68.7%、 ScienceBoard 54.0%。计算机使用智能体 Computer Use Agent CUA 看屏幕截图、点鼠标敲键盘想把「装主题、改表格、跨应用搬文件」这类桌面流程自动化。商业 Demo 已经能跑通要继续往上推研究侧更押可验证奖励的在线强化学习 RLVR 环境终态可被确定性函数打分再用在线交互更新策略。论文里有个 47 步装 GNOME 主题的例子逛主题站、下载解压、终端安装、再用gsettings切换。中间点错一次目录后面几十步往往白烧。 GUI 强化学习难首先是因为这种题通常只有指令和环境没有数学题那种现成判题器。Figure 2 训练后的 ScaleCUA 端到端完成 47 步跨应用任务从浏览 gnome-look.org 、下载 Orchis 主题到终端解压并用 gsettings 切换直到环境裁判给出 score1.0 。第二个坑在训练本身。多轮截图又长又贵同一题采一组轨迹做相对比较时如果全成功或全失败组内就学不到有效信号。若把每一步都拆成单独训练样本样本数又会跟着交互轮数直线涨——用 条轨迹、平均每条 步估算量级大约是 。把「可验证任务能不能规模化」「采样是否有效」「能不能做大规模在线 RL 」「多轮训练是否高效」这四条拆开看既往 GUI Agent 方法往往只覆盖其中一两项。 ScaleCUA 在表上四项都勾上了Table 1 代表性 GUI Agent 方法在四条缩放维度上的对比 ScaleCUA 是唯一四项全覆盖的一行。ScaleCUA 的做法是把「造可验证题」和「省着训」绑在同一条流水线上。 Qwen3.5-9B 版本 OSWorld 到68.7%开源侧此前较强的 Kimi K2.5 为 63.3% Claude Sonnet 4.5 为 62.9% ScienceBoard 到54.0%。代码、模型与数据集已开源。开源模型在 OSWorld 上的成功率对比 ScaleCUA 9B 68.7%高于更大参数的若干开源基线。同一训练流水线下可验证合成任务规模扩大 OSWorld 成功率同步抬升。框架数据侧造裁判训练侧盯能力边界ScaleCUA 分三块。VeriGen在 live Docker 桌面里迭代写出「指令 可执行裁判」。 Frontier Sampling 按每道题的实时成功率把采样压到「半会不会」的难度区。 Visual Context Segmentation 只保留最近 张截图做视觉输入文字历史不断档——避免 rollout 侧硬堆全部历史截图、训练侧又被超长多模态样本拖死。流程分三阶段先在 VeriGen 初期任务池上暖起来收集 rollout 后再做轨迹引导合成失败拆细、成功拼难最后在精炼池上跑带前沿采样与滑动窗的在线 RL 。ScaleCUA 总览左端 VeriGen 并行造可验证任务右端前沿采样 大规模 rollout 中间用视觉上下文切分喂训练引擎。VeriGen 在 Docker 里把 GUI 题写成可跑的裁判可验证 GUI 任务的标准很硬必须带确定性裁判例如查文件是否存在、读浏览器状态、跑一段 Python 根据终态打分不靠人或大模型口头判。VeriGen 用三个独立 Agent 闭环。 proposer 根据环境知识文档和容器接口起草题面与裁判 judger 做静态审查看指令是否歧义、裁判逻辑是否自洽 checker 在容器里实际点选读截图和无障碍树检验目标是否可达、裁判是否给终态打对分。两边都过才留下否则回灌下一轮。「写得出」还不够适合 RL 。轨迹引导阶段会读模型在旧题上的成功率和逐步反馈失败任务从最早偏题步切开变成更短的子目标成功任务在同应用内聚类再把目标与裁判串成更难的多目标题。环境侧有一层共享探头 docker interaction probe 合成 Agent 一律经这层接口取状态、下发动作才能撑到 100 合成工人并发对 100 环境。论文报告产出24K可验证候选最终约 3K 条进入高质量 RL 池。VeriGen 产出的可验证任务量相对既有桌面 CUA 方法高出约一个数量级。RL 池加入轨迹引导合成任务后训练过程中的任务级通过率更高。人工抽查里可执行裁判与专家标注在抽样轨迹上约 82.5% 一致有无轨迹引导时 OSWorld 测试从 64.6% 提到 68.7%。完整流水线裁判可执行率 94.5%去掉 LLM Judge 跌到 62.3%。独立审查和修复角色对「奖励函数能不能真跑」影响很大。Frontier Sampling 优先抽成功率贴近五成的题池子一大均匀抽题很快浪费。像 GRPO 这类「同一题采多条轨迹、比相对好坏」的算法若一组里全过或全挂学不到信号。课程学习固定难度表又跟不上「同一题过几天就从难变易」。Frontier Sampling 给每道题维护成功率的指数滑动平均 EMA 。训练前先全库试探丢掉过易或过难的题例如成功率落在 之外。之后每轮优先抽成功率贴近 50% 附近的题并约留两成名额随便抽免得采样盯死一小撮题。效果是采样会跟着能力边界滑太容易的少抽一时全挂的也少抽主要押在模型「半会不会」的那一批。Frontier Sampling 相对均匀采样、 DAPO 、课程学习能在更长训练步数里维持更高的平均通过率。Visual Context Segmentation 截图只留近窗文字历史不断GUI 轨迹有两种极端包装。整条当一个样本截图堆满上下文在线交互侧推理变慢每一步单独切样本、只留末帧截图训练条数又跟交互轮数一起涨。Visual Context Segmentation 的直觉是聊天文字全文保留屏幕图只盯最近 张。图太多就先把当前这段存成一条训练样本丢掉最早若干张再继续滚。文字链路不断档视觉 token 有上界样本数大约从 收到 。滑动窗切分示意截图只保留最近若干帧更早视觉丢掉可训部分主要覆盖助手回复。预先在窗口大小取 1 、 3 、 5 、 8 、 10 、 15 并在 2/4/8 节点规模上扫过单局最多 50 步时 取 5 到 8 对端到端步时最友好。相对「一步一切」的步进分解滑动窗在实验设定下给出2.83×加速策略更新段从 485s 降到 154s 参考模型前向从 241s 降到 88s 单步总计从 750s 到 265s 。滑动窗相对步进分解的分阶段耗时端到端约 2.83 倍加速。加速没有明显伤正确率。 OSWorld 上单次采样通过率 pass1 在 约 58.9%高于 的 56.4% 和 的 56.8%。个案呈倒 U 形把若干 Chrome 博文另存为 PDF 并按标题命名时 八次里过七次 容易忘掉命名约定 又被早期无关界面拖进循环。中等窗口更像是在「记得住目标」和「不被旧截图干扰」之间取折中。不同视觉窗口 下的 passk 中等窗口约 3–5 最好窗口过大并不自动更好。主结果开源桌面与科学软件两条线训练走在线强化学习一边大规模采样轨迹一边用相对比较类算法 GRPO 一族更新策略。骨干覆盖 GLM-4.6V-Flash 、 Qwen3-VL-8B-Thinking 、 Qwen3.5-9B 评测看桌面开放任务 OSWorld 和专业科研软件 ScienceBoard 。OSWorld 分域成功率。 ScaleCUA-Qwen3.5-9B 总体 68.7% Professional 89.5%、 Workflow 48.1%长流程相关子域抬得更明显。Qwen3.5-9B 从基座 41.8% 到 68.7%跳了 26.9 个百分点 GLM 与 Qwen3-VL 骨干上也是同向抬升。读这个数字时要连边界一起记可验证任务池扩起来之后 8B–9B 级可以上桌面公开榜但仍锁在 Ubuntu 、单局大约 50 步上限里。ScienceBoard 覆盖符号计算、分子可视化、 GIS 、 Lean 证明、天文模拟、 TeX 写作等。 ScaleCUA-Qwen3.5-9B 总体 54.0%略高于 Claude Opus 4.6 的 52.7%文档写作域 86.7% Lean 证明 19.0%论文列出的闭源对比最高不超过 15.4%。办公 GUI 之外专业科研软件也能配上可跑裁判这是 VeriGen 更值得记的一点。模型总体文档LeanClaude Opus 4.652.787.515.4ScaleCUA-9B54.086.719.0消融对照也很直接。完整 ScaleCUA 68.7%去掉 VeriGen 回到基座 43.9%去掉前沿采样 63.7%去掉视觉上下文切分 62.2%。三块各自掉分说明没有哪一块是单纯加戏。边界单局交互上限 50 步覆盖多数 OSWorld / ScienceBoard 题但代表不了超长流程。评测环境是 Ubuntu 桌面 Windows / macOS 应用栈没有直接结论。验证主要落在 8B–9B 级视觉语言模型更大或更小规模的行为还缺刻画。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
延伸阅读

更多相关文章

2026/9/14 11:38:49

5分钟掌握CFR:Java反编译终极实战指南

5分钟掌握CFR:Java反编译终极实战指南 【免费下载链接】cfr This is the public repository for the CFR Java decompiler 项目地址: https://gitcode.com/gh_mirrors/cf/cfr 你是否曾面对只有class文件的Java代码束手无策?CFR就是你的救星&#…

2026/9/15 11:06:19

C语言实现文件监控服务器:inotify与epoll事件驱动架构详解

1. 项目概述:一个C语言文件监控服务器的诞生 最近在准备一些技术复盘,正好翻到了之前做的一个小项目,一个用纯C语言实现的简单文件监控服务器。这玩意儿听起来可能有点“复古”,毕竟现在动不动就是Go、Rust,或者各种成…

2026/9/16 18:11:08

Redis Lua脚本原子性原理与实战:从单线程模型到分布式锁应用

1. 项目概述:为什么我们需要关注Redis Lua脚本的原子性? 如果你用过Redis,大概率听过或者用过 EVAL 命令。你可能知道它能执行Lua脚本,也模模糊糊地听说它能“保证原子性”,但具体怎么回事,为什么能保证&…

2026/9/16 18:47:25

MATLAB直接序列扩频仿真全解析:从m序列到误码率曲线

简介:直接序列扩频(DSSS)通信系统是通信工程与电子信息类课程设计的经典主题。基于MATLAB的仿真源码包面向通信、电子信息、自动化等专业学生,提供完整的系统仿真实现与配套文档,可满足课程设计、大作业或毕业设计需求…

2026/9/16 18:47:25

SSM与Spring Boot架构对比及技术演进解析

1. SSM与Spring Boot的技术定位解析在Java企业级开发领域,SSM(Spring Spring MVC MyBatis)和Spring Boot都是基于Spring生态的核心技术栈。作为从传统SSM架构过渡到Spring Boot的实践者,我认为理解二者的关系需要从技术演进的视…

2026/9/16 18:42:25

大模型如何革新游戏开发:从自然语言到智能生成

1. 项目背景与行业观察最近参加了一场关于游戏开发与智能技术融合的行业闭门会,现场演示的几款原型产品让我深刻感受到,游戏行业的技术迭代速度正在以肉眼可见的方式加快。其中有个demo让我印象深刻:开发者仅用自然语言描述游戏规则&#xff…

2026/9/16 12:52:37

拯救者Y7000黑屏故障排查与维修实战指南

1. 项目概述:一台黑屏的拯救者Y7000,到底卡在哪一步? 联想拯救者Y7000系列笔记本,从2018年第一代搭载i5-8300H开始,到后来的i7-9750H、i7-10750H、i5-11400H,再到2023年款的R7-7840HS,它始终是学…

2026/9/16 0:04:09

PHP源码部署实战:从环境配置到运行情侣游戏全攻略

简介:这是一套面向情侣互动场景的PHP完整源码,集成情侣飞行棋、真心话大冒险、情趣骰子等玩法,并内置完整分销制度,可自定义多种返佣比例,源码完全开源无加密,支持微信无感自动授权登录与第三方授权&#x…

2026/9/15 14:22:53

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/15 21:31:11

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/15 11:42:23

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码