Web Agent Token消耗怎么比?Webwright轨迹对比查看器完全指南

发布时间:2026/10/9 23:39:52

Web Agent Token消耗怎么比?Webwright轨迹对比查看器完全指南 Web Agent Token消耗怎么比Webwright轨迹对比查看器完全指南【免费下载链接】CUAWrightA simple SWE style browserdesktop agent framework that achieves SOTA results on long horizon web tasks.项目地址: https://gitcode.com/gh_mirrors/web/CUAWrightWebwright是一个 SWE 风格的浏览器 桌面 Web Agent 框架在长周期网页任务上取得了 SOTA 表现。每次运行 Webwright 都会落盘raw_responses.jsonl与trajectory.json两份轨迹文件配合仓库内置的轨迹对比查看器Trajectory Comparison Viewer你可以把不同框架、不同模型的 Web Agent 执行轨迹放进同一个页面快速比对 Token 消耗与完整执行步骤——无需写任何解析脚本。 3 步启动轨迹对比查看器一键开启查看器位于 assets/compare_trajectory/由 index.html 与 app.js 构成纯前端实现、零依赖只需一个静态服务器在仓库根目录执行cd assets/compare_trajectory/ python3 -m http.server用浏览器打开http://localhost:8000左右两个上传区各拖入一条 trace 文件页面自动解析并渲染对比结果整个页面由两个核心视图组成Summary View摘要对比与Detailed Trace详细轨迹顶部标签页随时切换。 支持哪 4 种轨迹格式trace 文件从哪里来格式文件来源Token 模式Webwright Responses JSONLraw_responses.jsonlWebwright 运行产物记录 thought / bash / final_response 帧估算可升级为精确Webwright trajectory.jsontrajectory.jsonWebwright 运行产物含 usage 快照精确Codex 会话 JSONL~/.codex/sessions/…/SESSION_ID.jsonlCodex CLI 本地会话记录精确含 token_count 快照Copilot 会话 Markdownsession.md对话中执行/export file session导出估算 Webwright 侧的两个文件由 base.yaml 中的output_path: outputs/default/trajectory.json指定输出位置raw_responses.jsonl则由模型层自动写入 models/base.py运行结束后直接取用即可。关键技巧上传 Webwright 的raw_responses.jsonl后页面会提供一个附加位——把同一次运行的trajectory.json挂上去Token 统计就会从估算estimate自动切换为精确exact。 精确 vs 估算看懂 Token 统计的两种模式查看器对 Token 的统计严格区分数据来源这是它比肉眼数日志可靠的核心精确模式exact直接读取 trace 中的 usage 快照。trajectory.json取messages[].extra.usage.cumulative_response解析逻辑见 app.jsCodex JSONL 取token_count事件快照app.js。估算模式estimate当 trace 不携带 token 信息时页面用浏览器端 tiktoken 分词器对提取出的文本按模型编码如o200k_base、cl100k_base映射表见 app.js重新计数并在界面上标注estimated。统计口径统一为 5 个维度input / output / reasoning / cached / totalapp.js因此不同框架的数字可以直接横向比较。 双视图详解对比矩阵与逐步执行轨迹Summary View一张矩阵看全 Token 差异加载两条 trace 后Summary 视图依次给出三块内容Comparison Matrix对比矩阵所有格式被归一化为 task hints、thoughts、commands、outputs、token provenance 行左右逐行对齐Per-Trace Summary单条摘要事件数、思考条数、命令数、最终响应数外加 Token 来源说明与 token 构成条形图Pattern Breakdown模式分解按命令家族如 python、curl、printf与事件类别聚合出 Top 条形图一眼看出两个 Agent 的行为偏好。Detailed Trace逐步回放每一步动作切到 Detailed Trace可按四个标签逐条翻阅标签展示内容Python提取出的 Python 脚本片段含 Playwright 代码Thoughts模型的思考/推理文字Commands每条 shell 命令、执行通道、退出码与输出Timeline上述内容合并后的完整时间线右侧界面即下图所示效果同屏展示左右两条 trace 的 STEP、REASONING 与 COMMAND便于逐条核对同一个网页操作两边各花了多少步、多少 Token。 实战案例同一任务Token 差了近 8 倍README 用一个真实任务做了基准对比Find the cheapest used 8-cylinder bmw made between 2005-2015, priced $25,000–$50,000, mileage 50,000 miles案例原文见 README.mdTokensWebwright HarnessCodex Webwright SkillInput420,4333,271,143Output3,59320,040Reasoning04,410Cached217,216—Total424,0263,291,183同一任务、同一模型能力档位下不同 harness 的总消耗差距接近 8 倍——这正是轨迹对比查看器最有说服力的地方把感觉更省变成可核查的数字。 常见坑位与排查清单Token 显示 estimate 而非 exact说明该 trace 无 usage 快照。Webwright 侧请附加trajectory.json只加载一条 tracePer-Trace Summary 仍可用但 Comparison Matrix 需要两条 trace 才会出现文件解析失败上传区会直接显示错误徽标确认文件属于上述 4 种格式之一支持.jsonl/.json/.md/.txt后缀识别逻辑见 app.jsCodex trace 找不到会话记录保存在~/.codex/sessions/YYYY/MM/DD/SESSION_ID.jsonl按日期目录查找。总结把 Token 账算明白Webwright 轨迹对比查看器用一次拖拽上传就解决了三个问题Token 消耗是否可信exact/estimate 双模式标注、执行路径是否高效逐步命令与思考回放、框架之间差距多大归一化对比矩阵。如果你正在评测 Web Agent 框架或优化长周期任务成本建议把它作为标准验收工具——相关功能说明可查阅 README.md 的 Trajectory Comparison Viewer 章节。【免费下载链接】CUAWrightA simple SWE style browserdesktop agent framework that achieves SOTA results on long horizon web tasks.项目地址: https://gitcode.com/gh_mirrors/web/CUAWright创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/10/9 23:39:52

pstack诊断Claude Code卡死:从进程栈到根因排查实战

我不知道你有没有在终端里经历过这种时刻:Claude Code正写到一半,突然不再吐字,光标也不闪,你按了几次CtrlC,信号像扔进了一个无底洞,最后只能打开另一个终端窗口,忍痛把这个进程杀掉。我之前一…

2026/10/9 23:39:52

MiniOB源码解析:从SQL解析到存储引擎的数据库内核实现

简介:基于C的MiniOB数据库管理系统源码包,由OceanBase与华中科技大学联合开发,面向数据库初学者与在校学生,提供一套入门级数据库内核实践工具。项目对并发、安全等复杂特性做了简化,重点帮助学习者快速建立对存储引擎…

2026/10/10 0:34:57

AI大模型初探-接入API:用TaoToken统一Key打通Unity与DeepSeek

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 0:34:57

Pake实战:用Tauri+WebView把网页打包成轻量桌面应用

1. 为什么我推荐用 Pake 来打包网页应用你可能也有这种经历:某个网页工具每天都用,却要在浏览器里忍受一堆标签页、书签和无关页面的干扰;或者公司后台、BI 看板、在线文档明明就是网页,却总缺少一个像样的桌面入口。把网页打包成…

2026/10/10 0:34:57

现代浏览器架构详解:多进程、渲染进程与性能优化

我当年准备面试的时候,最怕被问到“浏览器是怎么工作的”。地址栏输入 URL、DNS 解析、HTTP 请求、渲染页面,这套词背得滚瓜烂熟,但面试官只要追问一句“那这些活儿是哪些进程干的?渲染进程里面又有什么线程?”&#x…

2026/10/10 0:34:57

Flow3D+EDEM耦合模拟LPBF粉末床与熔池流动全流程详解

做粉末床激光增材制造(LPBF)的模拟,最让人头大的不是激光怎么设,而是粉末床本身怎么建得真实。我试过直接在Flow3D里用随机算法铺粉,也试过EDEM从零仿真实铺粉过程,最后跑通一整套Flow3DEDEM耦合的熔池流动…

2026/10/10 0:34:57

LangChain Multi Agent 实战:用 TaoToken 统一 Key 跑通多智能体协作

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 0:29:57

深度学习量化交易闭环:从LSTM建模到Backtrader回测

简介:本资源是一套面向高校学生与AI初学者的深度学习量化交易实践项目,适用于毕业设计、课程设计及期末大作业等综合性实践场景,聚焦于用人工智能方法解决股票价格预测与自动化交易策略构建问题。压缩包共49个文件,以42个Python脚…

2026/10/8 10:03:18

Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化

1. 从“Jev”说起:为什么我要把Agent接进浏览器“Jev”这个词最近在圈子里出现的频率越来越高,很多人第一次听到会以为是某个新模型的名字,其实它更像是一种思路——把Jev模型的能力当作底座,通过Agent的方式去接管浏览器&#xf…

2026/10/9 20:15:56

多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系

1. 从"单兵作战"到"集群协同":多智能体编排到底在解决什么问题如果你最近在折腾 Agent 相关的东西,大概率会有一种感觉:单个 Agent 能做的事情,其实很快就摸到天花板了。你给它一个提示词,挂几个工…

2026/10/8 6:05:44

无源低通滤波器设计实战:从RC到LC,手把手教你避开那些坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 0:04:53

从逻辑门到计算机:数字电路核心原理与全加器搭建实战

如果你拆过一台旧电脑的主板,盯着那些黑乎乎的小芯片看上一会儿,可能会冒出同一个疑问:这堆引脚密集的元件,到底是怎么“变”出那么复杂的应用的?答案并不在某个神秘的部件里,而是在所有芯片内部都在反复使…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑