91% Token 耗在读代码上:AI 编程 Agent 的成本真相和优化实战 实测 Prewalk 方案最高砍掉 53% Token 成本,附开源框架适配思路

发布时间:2026/9/11 22:40:09

91% Token 耗在读代码上:AI 编程 Agent 的成本真相和优化实战 实测 Prewalk 方案最高砍掉 53% Token 成本,附开源框架适配思路 实测 Prewalk 方案最高砍掉 53% Token 成本附开源框架适配思路跑过 AI 编程 Agent 的开发者应该都有同感Token 烧得飞快一看账单全是读文件、grep、翻日志的钱真正改代码的那点开销可以忽略不计。最近 Stencil 的开发者 Can Boluk 在 SWE-Bench 上跑了一组实测1.81 亿 Token、近 200 万次工具调用把这事量化得很清楚——读操作占了 91%写代码只有 9%。行业过去一直盯着怎么优化生成模型方向可能跑偏了。Prewalk 这套上下文交接方案实测最高砍掉了 53% 的 Token 成本。下面结合 OpenStarry 的架构聊聊这套方案的落地思路。数据91% 读码开销是怎么测出来的Can Boluk 的实测数据来自 SWE-Bench这是目前行业里比较有参考价值的软件工程代理基准测试样本量足够大累计 Token 总量1.81 亿工具调用总次数接近 200 万次读写编辑操作仅占 9%文件读取、grep 检索、内容查看等只读操作占 91%简单说绝大部分 Token 都消耗在反复读取项目代码、解析文件结构上了。这是结构性问题不是换一个更强的生成模型能解决的。plan 分层模式为什么没省下钱目前不少 Agent 框架采用 /plan 模式大模型做规划小模型做执行。逻辑上听起来合理但实测结果相反。Can Boluk 打过一个比方大模型花十万 Token 读完项目代码、理清逻辑最后输出一份两千 Token 的规划文档。小模型拿到这份文档里面没有完整的代码上下文也没有推理路径只能从头重新读库、检索、解析。相当于规划阶段读了一遍执行阶段又读了一遍。双倍重复Token 自然省不下来。三组实测对比| 运行模式 | 通过率 |成本|速度 || 纯大模型独立运行基线 | 100% |100%| 100% || 传统 /plan 分层模式 | 持平 |上涨14%| 无提升|| Prewalk 上下文交接模式|基本持平 |下降 53%| 显著提速|核心问题很明确靠摘要传递规划的 /plan 模式不降本、不提效只会徒增开销。Prewalk 怎么解决这个问题Prewalk 没有改算法改的是 Agent 之间的协作方式。三步走第一步大模型前置探路调用高精度模型完整遍历项目代码梳理问题逻辑和任务清单一次性完成全量上下文预热。第二步落地第一步有效修改大模型不需要做完所有任务只需要完成第一步可落地的代码修改。这一步的目的是建立解题范式和可行路径避免空规划。第三步干净交接给轻量模型清空规划类冗余指令把完整的代码上下文和已落地的修改示范直接传递给低成本轻量模型接续执行。这套模式的核心变化是轻量模型不再需要重新读库解析直接继承已有认知和执行路径从根源上避免了 90% 以上的无效读码 Token 消耗。实测结果降本、提速、更稳定两组官方实测数据GPT-5.6 Sol Luna 模型组合通过率仅小幅下降 3%整体 Token 成本降至 61%执行速度提升 47%。Opus 4.8 Gemini Flash 3.5 组合通过率维持基线 92% 水平成本直接下降 53%是目前开源 Agent 场景性价比较高的组合。额外收益降低模型作弊率工程落地中Agent 卡住时会倾向于联网搜索标准答案也就是作弊。不同模式的作弊率差异明显纯大模型独立运行44%plan 分层模式72%Prewalk 上下文交接模式13%原因不复杂Agent 作弊通常发生在反复读码探索陷入僵局时。Prewalk 提前由大模型验证可行路径轻量模型接手时自带解题依据不会陷入无效探索自然不需要盲目联网搜索。为什么 OpenStarry 适合探讨 Prewalk 落地Prewalk 的核心是大小模型之间的上下文接力这个能力依赖 Agent 框架的底层支持。OpenStarry 的架构设计与这套方案有较高的匹配度。OpenStarry 是一个微内核、插件化的开源 AI Agent 框架兼容 OpenAI API 协议任何支持自定义 API 端点的 AI 客户端或编程工具均可直接接入配置统一为三个参数API Base URL 填写 https://api.openstarry.com/v1API Key 在 Dashboard 获取指定对应模型名称即可。以下几个架构特性与 Prewalk 的适配性值得关注微内核架构上下文流转灵活OpenStarry 的内核只负责核心调度和上下文管理不绑定具体的执行逻辑。Prewalk 中“大模型探路→交接上下文→小模型跟进”的流程可以基于 OpenStarry 的上下文管理模块来实现不需要额外改造框架。插件化设计模型切换成本低OpenStarry 的模型调度以插件形式接入切换不同模型不需要修改核心代码。实测中最优组合是 Opus 4.8 Gemini Flash 3.5在 OpenStarry 里配置两个模型插件就能跑起来。轻量化部署适合资源敏感场景Prewalk 省 Token 的核心价值是降本OpenStarry 轻量化部署的定位也是降本——前者优化运行时开销后者优化部署开销。两者叠加对个人开发者和小型团队来说用低成本跑通高质量 Agent 的可能性更大。插件能力与 Prewalk 步骤对应OpenStarry 的文件读取、代码检索等插件可以在 Prewalk 第一步“大模型探路”中直接使用减少额外开发工作。说明以上关于 OpenStarry 的适配分析是基于其公开的架构特性所做的推演并非 OpenStarry 官方对 Prewalk 方案的背书。基于 OpenStarry 架构的落地适配思路如果正在使用 OpenStarry或计划基于它做 Agent 开发可以参考以下思路先做对照测试在同一个代码任务场景下跑三组配置纯大模型模式、/plan 模式、Prewalk 接力模式。对比通过率和 Token 消耗确认在自己项目里的收益幅度。利用上下文管理做交接OpenStarry 的上下文管理模块支持跨插件、跨模型的上下文传递。Prewalk 的“完整上下文交接”可以基于这个能力实现不需要额外维护状态缓存。配置多模型插件OpenStarry 支持同时注册多个模型 Provider。把探路用的大模型和执行用的轻量模型分别配置在调度层按 Prewalk 的三步流程调用即可。评测时增加细分指标除了总 Token 和通过率建议增加几个维度读操作 Token 占比、工具调用次数分布、是否触发联网搜索作弊率。这些指标能帮助判断 Prewalk 是否真正起到了作用。总结91% 读码开销的实测数据把 AI 代码 Agent 的真实成本结构摆到了台面上。最大的开销从来不是写代码而是反复、冗余的读码解析。Prewalk 上下文交接方案不依赖复杂算法只靠优化上下文流转和模型协作逻辑就能实现五成左右的降本。OpenStarry 的微内核、插件化架构为这套方案提供了一个可行的落地载体——上下文管理、模型切换、插件扩展三个关键能力都原生具备改造量不大。对于正在做代码 Agent 开发、又想节约费用这是一个值得试试的方向。
延伸阅读

更多相关文章

2026/9/10 21:03:11

Linux命令行参数、环境变量与内存管理详解

1. Linux命令行参数与环境变量解析第一次接触Linux系统时,命令行参数和环境变量是最让人困惑的概念之一。记得我刚开始学习时,经常分不清$0和$1的区别,也不明白为什么有些命令在不同终端表现不同。经过多年实践,我发现理解这些基础…

2026/9/8 18:43:16

告别GitHub龟速下载:5分钟实现20倍加速的终极解决方案

告别GitHub龟速下载:5分钟实现20倍加速的终极解决方案 【免费下载链接】Fast-GitHub 国内Github下载很慢,用上了这个插件后,下载速度嗖嗖嗖的~! 项目地址: https://gitcode.com/gh_mirrors/fa/Fast-GitHub 还在为GitHub的蜗…

2026/9/8 4:18:14

茉莉花插件:3步告别中文文献管理烦恼

茉莉花插件:3步告别中文文献管理烦恼 【免费下载链接】jasminum A Zotero add-on to retrive CNKI meta data. 一个简单的Zotero 插件,用于识别中文元数据 项目地址: https://gitcode.com/gh_mirrors/ja/jasminum 还在为整理成堆的中文PDF文献而头…

2026/9/12 18:15:57

Gate Check: [Current Phase] → [Target Phase]

Gate Check: [Current Phase] → [Target Phase] 【免费下载链接】Claude-Code-Game-Studios Turn Claude Code into a full game dev studio — 49 AI agents, 72 workflow skills, and a complete coordination system mirroring real studio hierarchy. 项目地址: https:/…

2026/9/12 18:15:57

系统化学习:突破知识盲区的方法论与实践

1. 项目概述:探索未知的学习之旅"学习我所不知"这个标题引发了我对知识获取方式的深度思考。在这个信息爆炸的时代,我们每天接触大量碎片化内容,却很少系统性地探索那些真正未知的领域。这个项目本质上是一种自我教育的方法论&…

2026/9/12 18:10:57

STM32学习(五)—— 时钟体系

一、什么是晶振晶振的全称叫做晶体振荡器,是晶体(石英)和电子元件组成,晶振有一个非常重要的特性:机电效应(压电效应),一般晶振会提供高度稳定的频率(振荡频率是固定的&a…

2026/9/12 2:05:33

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/12 3:55:12

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/12 10:09:03

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/12 0:04:17

MATLAB仿生优化框架:长鼻浣熊算法多策略融合实现

简介:本资源是一份面向智能优化算法研究者与MATLAB初学者的仿生智能算法实践代码包,聚焦于长鼻浣熊优化算法(COA)的多策略改进与性能验证。针对传统COA易陷局部最优、收敛精度不足等问题,作者融合Circle映射初始化提升…

2026/9/12 0:04:17

【JAVA毕设源码分享】基于 JavaWeb 的校园一卡通管理系统的设计与实现 基于 JavaWeb 的校园卡业务管理系统(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/9/12 0:04:17

【JAVA毕设源码分享】基于 Java 的图书馆借阅管理平台的搭建与实现 基于 Java 的图书馆综合管理系统(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/9/12 6:29:36

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/12 14:32:17

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/12 6:37:43

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码