Asana浏览器Agent成本降76倍:GPT-6.1 Sol工程拆解

发布时间:2026/10/10 17:54:55

Asana浏览器Agent成本降76倍:GPT-6.1 Sol工程拆解 Asana的StackAI平台让客户无需写代码就能构建浏览器工作流导航网站、填写表单、采集信息。规模一大单次运行中微小的低效就会被放大。StackAI CTO Frank Hidalgo用GPT-6 Astra在Codex中调查Agent、测试改进并对比结果把原本估计需要一到两个月的手工研究压缩到约一周。问题定位缓存漏掉了增长最快的部分Hidalgo先让GPT-6 Astra在Codex中梳理代码库解释Agent如何构造每一次模型请求。Astra发现Agent缓存了固定指令和工具定义但没有缓存不断增长的页面文本与截图历史因此每次请求都以全价重发这段历史。更麻烦的是Agent几乎每一步都会丢弃旧截图、裁剪文本。每次编辑都会改变历史所以单独缓存历史并不能解决问题而丢失这些事实又可能迫使Agent重新访问已经读过的页面。三项被选中的修复Hidalgo审阅Astra提出的修复方案后选择三项进行测试把缓存扩展到Agent的浏览历史提高可保留文本的数量批量移除截图而不是每一步都移除由于原代码并非为受控实验设计Astra先重构代码让一个前端和后端能并行支持多个工作流每个工作流有自己的设置。随后Astra执行了完整研究历史预算为120,000和480,000字符六种缓存与截图策略每种在四个模型上各测三次共144次运行。表现最好的策略允许截图累积到20张再回退到最近一张。这样在两次移除之间有更长的时间段保持早期历史不变。配合更大的历史预算它成为最终的优化工作流。每个配置执行同一任务从一个公开演示目录中为32本书各采集6个字段代表部分Asana客户在StackAI中运行的工作负载。成本与延迟结果对原生产模型Model B优化把估计模型成本从至少36.21美元部分原始运行在完成前就触及步数上限降到每次1.24美元降幅29倍。在GPT-6.1 Sol上的优化工作流再便宜2.6倍为0.47美元。优化工作流中的每次运行都完成了任务并返回正确答案。仅在GPT-6.1 Sol上配合更大的历史预算新的缓存与截图策略把成本从1.97美元降到0.47美元降低4倍。每次调用约便宜3倍因为89%的输入来自缓存而缓存价格仅为未缓存价格的5%。速度同样改善原始Model B设置至少22.5分钟GPT-6.1 Sol优化工作流约4分钟。历史管理还直接影响Agent能否给出答案。给GPT-6.1 Sol更大的浏览历史保留空间后产生答案的运行数从较小预算下的18次中3次提升到较大预算下的全部18次且答案均正确。工程可复用的降本路径从这项研究中可以提炼出几条对浏览器Agent通用的工程判断第一先审计请求构成。固定指令和工具定义通常早已被缓存真正吃掉成本的是随步骤增长的页面文本与截图历史。如果这部分没有缓存每次请求都在为重复内容付全价。第二缓存策略必须与历史编辑策略一起设计。如果Agent频繁裁剪或丢弃历史缓存命中率会被不断打断。Asana的解法是让历史在更长的时间段内保持不变再批量清理。第三历史预算不是越大越好但太小会直接损害任务完成率。18次运行中只有3次给出答案说明预算不足时Agent可能根本无法收敛。第四模型迁移和Agent优化是两件事。Model B优化后降29倍换到GPT-6.1 Sol再降2.6倍。两者叠加才达到76倍。第五实验基础设施值得提前投入。Astra先重构代码以支持并行工作流和独立设置才使144次受控运行成为可能。从实验到产品Asana已把浏览器导航的改动发布到StackAI并正在开发工具让类似实验更容易重复。团队计划把这种测试纳入平台评估让客户和内部团队在配置Agent时比较成本、运行时间和答案质量。Asana还在用GPT-6 Astra在Codex中做发布前产品测试Astra导航平台、尝试不同输入并向人工QA报告缺陷。Hidalgo把这视为新软件开发生命周期的基础多个云Agent会话并行测试功能。他的判断是发布速度不再是瓶颈人的注意力才是。
延伸阅读

更多相关文章

2026/10/10 17:54:55

抖店费用转换 v1.1.0:13 规则流水级直查的实操

抖店费用转换 v1.1.0:13 规则流水级直查的实操抖店费用转换v1.1.013 规则流水级直查应付带符号净额费用应付单费用应收单销售收款单提现金蝶云星空抖店费用转换 v1.1.0 13 规则 流水级直查 应付带符号摘要:抖店的资金账单把所有费用项塞进同一份 CSV——…

2026/10/10 17:54:55

AI Agent与大模型结合的工程架构设计指南

在AI Agent的讨论中,当前搜索结果中的社区资料常提到一个比喻:大模型如大脑,Agent则是人工智能的手脚和感官系统,大模型需与Agent结合才能真正发挥作用,解决实际问题。这一说法可作为工程参考的公开观点,但…

2026/10/10 17:49:54

小波滤波实战:加速度计信号去噪的Python实现与避坑指南

简介:这份资源面向物联网、传感器及数据分析方向的开发者与学习者,聚焦一维传感数据的小波滤波去噪实践。内容围绕小波分析基础、小波滤波原理及Python实现展开,帮助读者理解如何借助pywt库完成信号分解、阈值处理与重构,从而提取…

2026/10/10 19:05:37

可落地的时间序列Transformer模型构建指南

简介:本资源是一套基于Transformer架构实现时间序列预测的Python完整源码项目,面向高校学生、AI初学者及期末课程设计者,解决传统RNN/LSTM在长时序建模中注意力机制不足的问题,适用于金融时序(如股价、汇率&#xff09…

2026/10/10 19:05:37

Axure多角色登录原型实战:从全局变量到权限控制

刚开始接触Axure原型设计的时候,遇到“多角色登录”这种需求,我第一反应也是有点懵:不就是登录页加个下拉框,选完角色跳转到对应页面吗?等真正做完一轮再回头看,才发现这里面的坑远比想象的多。角色判断、权…

2026/10/10 19:05:37

从“cua”到完整方案:信息残缺需求的推进方法

那段时间,我们团队手上压着三个项目,排期表上全是“紧急且重要”。结果我打开需求文档,正文栏只有三个字母:“cua”。没有需求背景,没有功能说明,连一句“你自己品品”的玩笑都没留下。我盯着这三个字母看了…

2026/10/10 19:00:35

抗周期AI能力栈:从模型网关到数据治理的选型实战

这些年我一直在基础设施和应用研发一线反复踩坑,越来越意识到一个道理:AI项目的成败,往往不取决于你有没有用上最强模型,而取决于你搭建的整个AI能力栈是否足够“抗周期”。所谓抗周期,不是嘴上说的“稳定”&#xff0…

2026/10/10 7:31:36

Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化

1. 从“Jev”说起:为什么我要把Agent接进浏览器“Jev”这个词最近在圈子里出现的频率越来越高,很多人第一次听到会以为是某个新模型的名字,其实它更像是一种思路——把Jev模型的能力当作底座,通过Agent的方式去接管浏览器&#xf…

2026/10/9 20:15:56

多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系

1. 从"单兵作战"到"集群协同":多智能体编排到底在解决什么问题如果你最近在折腾 Agent 相关的东西,大概率会有一种感觉:单个 Agent 能做的事情,其实很快就摸到天花板了。你给它一个提示词,挂几个工…

2026/10/8 6:05:44

无源低通滤波器设计实战:从RC到LC,手把手教你避开那些坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 0:04:53

从逻辑门到计算机:数字电路核心原理与全加器搭建实战

如果你拆过一台旧电脑的主板,盯着那些黑乎乎的小芯片看上一会儿,可能会冒出同一个疑问:这堆引脚密集的元件,到底是怎么“变”出那么复杂的应用的?答案并不在某个神秘的部件里,而是在所有芯片内部都在反复使…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑