发布时间:2026/8/24 13:51:22
Agent 可观测性双雄:Cloudflare Agent Tracing 与阿里 AgentSight(eBPF)——「HTTP 200 不代表 Agent 正常」时代的调试基座 本文基于 2026-08-22 情报快照,数据以原文为准。摘要:一个 Agent 即使返回 HTTP 200,也可能选错工具、把过时上下文交给子 Agent、或在重试循环里持续烧 Token——传统 HTTP 遥测对此一无所知。Cloudflare 在 8 月初的 Agents Week 上线 Agent Tracing,阿里则在 8 月 21 日开源 AgentSight:前者把 Agent 行为做成平台内置的标准 Span,后者用 eBPF 在内核层零侵入观测。本文拆解两条路线的机制、限制与选型建议。一、痛点:为什么传统遥测看不到 Agent传统可观测性观测的是「服务」,不是「行为」。一次 API 请求返回 200,只能说明请求被处理完了,不能说明 Agent 的任务成功了。InfoQ 在报道 Cloudflare Agent Tracing 时把这个问题说得最直白:「一个 Agent 即使返回 HTTP 200,也不意味着它运行正常。它可能选择了错误的工具,将过时的上下文交给 Subagent,或者在重试循环中不断消耗 Token。」这类失败有一个共同特征:它们发生在 HTTP 语义之外。模型选错了工具、工具参数拼错、子 Agent 拿到过期上下文、SSE 流中途截断但网关仍回了 200、一次重试循环烧掉上千 Token——应用层遥测只能告诉你「发生过一次 API 请求或数据库查询」,却无法回答「是哪个 Agent 行为导致了这一切」。想象一次典型的排查:业务方报告「订票 Agent 又没订上票」,后端日志显示请求全部成功,HTTP 200、数据库写入正常,但你不知道模型在哪一步做了错误决策、调用了哪个工具、消耗了多少 Token、以及它有没有把任务委托给一个状态异常的 Subagent。在 Agent 化之前,这类问题根本不存在——单体服务的行为就是代码路径,看日志就能还原;Agent 的行为是模型在运行时生成的,代码路径只能告诉你「它可能做什么」,不能告诉你「它实际做了什么」。Cloudflare 的 Workers Tracing 此前已经覆盖基础设施层(Fetch、KV、D1),但 Agent 跑在 Workers 上时,trace 里只有这些基础设施 Span,唯独缺 Agent 自身的行为。8 月 21 日至 22 日,两条情报几乎同时刷屏:InfoQ 详细报道了 Cloudflare 的 Agent Tracing(该功能 8 月 4 日随 Agents Week 上线),阿里开源项目 anolisa 发布了基于 eBPF 的 AgentSight。两条路线一「内置」一「旁路」,恰好构成 Agent 可观测性的双雄格局。二、路线一:平台内置 —— Cloudflare Agent TracingAgent Tracing 是 Cloudflare 在 2026 年 8 月 4 日 Agents Week 上随 Cloudflare Agents 一起发布的第一个组件(官方博客原话:「First stop: agent tracing」),InfoQ 中文站在 8 月 22 日做了详细报道。它的思路是在现有 Workers Tracing 之上增加 Agent 级 Span,让每一轮交互生成一条结构化的 Trace:invoke_agent {agent class} ├── chat {model} └── execute_tool {tool} └── tool_approval {tool}模型信息与 Token 用量作为元数据附加在 Span 上;子 Agent 的工作会嵌套在调用它的操作之下。官方博客给了一个 Travel_Planner 的例子:父 Agent 把行程规划委派给 itinerary_builder 子 Agent,整个调用链 2.72 分钟,其中 1.83 分钟花在子 Agent 上——子 Agent 的模型调用(如 cf/zai-org/glm-4.7-flash)、工具执行、D1 查询与 KV 写入全部出现在同一条瀑布流里。三个字段用于身份关联:Agent name(逻辑实现)、Agent ID(具体实例)、Conversation ID(会话);Cloudflare 特别提醒不要用请求或用户标识动态生成 Agent name,否则 Dashboard 会塞满碎片化的 Agent 条目。社区对瀑布流视图的反响相当直接:有开发者在 Cloudflare 的 X 公告下留言,想在自己的 Agent 框架(Hermes)上试用这个功能,理由正是「能直接看到模型调用下面紧接着一个错误的工具参数」。接入成本按技术栈分化:Think 与 Flue v2 自动埋点;直接调 AI SDK 需用wrapAISDK()封装(v6/v7);自定义 Harness 则走 Workers Custom Spans API 并遵循 OpenTelemetry GenAI 语义约定——Workers 目前还不直接支持 OpenTelemetry API,官方称正在开发。开启方式也简单,在 wrangler 配置里打开开关即可:// wrangler.jsonc(官方文档示例) { observability: { traces: { enabled: true } } }Span 属性遵循 OTel 生成式 AI 语义约定,可导出到任意 OTLP 端点,这让 trace 不只是调试工具,还能喂给评测与成本报表,构成官方所说的「自改进 Agent」闭环的数据基础。值得警惕的是三点限制。其一,Payload 默认策略因框架而异:Think 与wrapAISDK()默认不保存消息/工具 Payload(需显式开storeMessages/storeTools),而 Flue 默认保存消息、系统指令、工具定义、参数与结果(需设content: false关闭)——同一平台,默认隐私策略可能完全相反,而消息 Payload 里又经常夹带个人数据或 Secret。其二,计费以 Span 为单位:每个 Span 计一次 Observability Event,包括 Agents 视图里看不到的 SDK 内部 Span;Beta 免费,2026 年 10 月 1 日起纳入 Workers Observability 计费(Free 每天 20 万事件、保留 3 天;Paid 每月 2000 万、保留 7 天,超出部分每百万 0.60 美元),复杂 Harness 的 Span 数量可能远超 Dashboard 给人的直观印象。其三,官方明确 trace 不是完整无损的会话记录:长消息、推理过程、工具参数与结果可能被截断,Session Replay 不显示图片,审批 Span 只表示 Worker invocation 内部的生命周期事件,并不记录用户跨 invocation 响应的人工等待时长——而 HITL 审批延迟恰恰是团队最想观测的指标之一。三、路线二:内核零侵入 —— 阿里 AgentSight(eBPF)与 Cloudflare 相反,阿里的 AgentSight 不依赖任何 Agent 框架。它属于 alibaba/anolisa(Agentic OS 定位的 Rust 开源项目,Apache-2.0,2026-08-22 实测 381 星、97 fork,最近仍在提交)的可观测性组件,于 8 月 21 日以 Show HN 形式发布。方案核心一句话:基于 eBPF 在内核层捕获 LLM API 调用、Token 消耗与进程行为,不改一行 Agent 代码——官方文档的原话是「从内核向上看 Agent 运行」(See an Agent run from the kernel up)。捕获能力分四块:Token 多维度计账(按 Agent、任务、模型)、行为审计(LLM 调用与进程执行全链路)、Agent 自动发现(扫描系统中运行的 Agent 进程)、Web Dashboard(localhost:7396,远程访问需 Token 鉴权)。最具产品价值的是中断检测清单,五种异常各有判定规则与严重级别:类型判定规则默认级别llm_errorHTTP 400 或 SSE body 含错误highsse_truncatedSSE 流未以 finish_reasonstop 结束highcontext_overflow上下文长度超限highagent_crashAgent 进程会话中消失criticaltoken_limitfinish_reasonlength 且输出接近上限medium零侵入是有代价的:前置条件为 Linux、内核 5.8(BTF 支持)、root 或 CAP_BPF 权限,macOS 上没有 eBPF(只提供扫描本地 JSONL 会话文件的 trace 命令与 Dashboard serve)。安装与日常查询都走 CLI(均出自官方文档):# 安装(需 root,Linux x86_64)sudoanolisainstallagentsightsudosystemctlenable--nowagentsight.service# 日常查询:Token 用量与中断事件sudoagentsight token--periodweek--comparesudoagentsight interruption list--typecontext_overflow服务启动后 Dashboard 监听localhost:7396,agentsight audit则覆盖行为审计查询。在 anolisa 的生态里,AgentSight 还承担「成本度量器」的角色:与 Tokenless 组件联动展示省下的 Token 数,官方 README 提到某次编码任务基于 AgentSight 测量省了 31.7 万 Token(40.5%),并可与 Copilot Shell 对话式查询「今天用了多少 Token」。需要说明的是,官方文档未公布 eBPF 探针的性能开销基准,目前能看到的量化信号只有运行时上限(如 eBPF Ring Buffer 32MB、事件通道容量 1 万、数据库超过 200MB 自动清理)——对生产环境压测时需自行验证。四、落地建议:三条路怎么选平台集成(Cloudflare 系)。如果 Agent 已经跑在 Workers/Think/Flue 上,Agent Tracing 是零成本选择:开observability.traces.enabled即可拿到 Span 级语义与统一 Dashboard。代价是绑定平台、按 Span 计费,且要按框架确认 Payload 默认策略。eBPF 旁路(AgentSight 系)。适合自托管、多框架混合、或 K8s 上跑了一堆互不相关的 Agent 的团队——不侵入代码意味着对存量系统零改造,任何框架(LangChain、Claude Code、自研 harness)只要发 LLM API 请求就能被捕获。代价是内核版本与权限要求,以及尚未公布的性能开销。自插桩(OTel 路线)。需要跨平台统一语义、或要把 trace 送进自建监控体系时,直接按 OTel GenAI 语义约定埋点最稳;Cloudflare 也在补这块,未来任意 OTel 兼容框架有望免埋点接入。三者的取舍可以浓缩为一张表:维度平台内置(CF)eBPF 旁路(AgentSight)自插桩(OTel)侵入性框架内集成零侵入需改代码框架范围Think/Flue/AI SDK任意 LLM 调用任意环境要求Cloudflare WorkersLinux 5.8/root无语义标准OTel GenAI 约定自研事件模型OTel GenAI 约定无论哪条路,建议先盯五个指标:Token 用量与成本、工具成功率、审批延迟(注意 Cloudflare Approval Span 的局限)、中断率(SSE 截断/上下文溢出)、子 Agent 耗时占比。对治理与审计而言,两条路线都提供了此前没有的抓手:AgentSight 的 audit 命令与中断清单适合做运维闭环,Cloudflare 的 trace 可导出 OTel 喂给评测——但双方都明确 trace 不是无损审计记录,payload 截断与隐私策略决定了它不能直接当合规日志用,把它当作「调试与成本观测」而非「完整证据链」是更稳妥的定位。总结两条路线殊途同归:「Agent Runtime 需要自己的遥测层,仅靠基础设施 Span 无法解释 Agent 究竟做了什么」——InfoQ 用这句话概括了包括微软 Agent Framework 默认开启 OpenTelemetry、Azure APIM AI Gateway 导出 Token 指标在内的整个行业趋势。平台内置赢在语义标准与开箱即用,输在平台绑定与按 Span 计费;eBPF 旁路赢在零侵入与框架无关,输在内核依赖与开销未明。接下来值得盯的三件事:Cloudflare 的 OTel API 直接支持何时落地、AgentSight 是否补上性能开销基准、以及行业能否在 Agent 遥测语义上走向统一——那才是「HTTP 200 不代表 Agent 正常」真正被解决的一天。参考链接Cloudflare 官方博客《Introducing: Cloudflare Agents》:https://blog.cloudflare.com/agents-on-cloudflareCloudflare Agents 文档 · Tracing:https://developers.cloudflare.com/agents/runtime/operations/observability/tracing/InfoQ 中文《Cloudflare 推出 Agent Tracing:支持截断限制,不同框架的 Payload 默认记录策略存在差异》(2026-08-22):https://www.infoq.cn/article/IBYDTeu3rse9tH3549wfalibaba/anolisa 仓库:https://github.com/alibaba/anolisaAgentSight 官方文档(英文):https://github.com/alibaba/anolisa/blob/main/docs/user-guide/en/agent-observability/agentsight.mdAgentSight 官方文档(中文):https://github.com/alibaba/anolisa/blob/main/docs/user-guide/zh/agent-observability/agentsight.mdShow HN:AgentSight(2026-08-21):https://news.ycombinator.com/item?id49389493Cloudflare Agents Week 总结:https://blog.cloudflare.com/agents-week-review-august-2026/

相关新闻

2026/8/24 13:51:22

IPD_概念决策CDCP评审要素表

概念决策评审要素表 目录与索引 1 概念决策评审点... 4 2 对市场的了解... 4 3 产品/产品包... 4 4

2026/8/24 13:46:22

双脉冲开关测试中考虑电路寄生影响的波形分析

参考文献:Performance Comparison of Standalone 4H-SiC JFETs and Cascode Devices at Cryogenic Temperature 在双脉冲测试中,器件开关波形受到功率回路寄生电感、续流二极管结电容、器件非线性结电容、封装键合线和内部栅极网络的共同影响。开通过程中…

2026/8/24 16:16:42

精准广告投放系统

在数字化营销时代,精准广告投放已成为企业获取客户、提升品牌影响力的核心手段。一个高效、智能的广告投放系统,能够帮助企业将预算花在刀刃上,实现品效合一。本文将结合市场现状、具体数据和案例,为您解析专业定向精准广告投放系…

2026/8/24 16:16:42

android_状态机

1 MediaPlayer State2 MediaCodec State3 ACodec State3.1 ACodec状态机转换实例下面将介绍ACodec从无状态到UninitializedState状态的的转换流程。ACodec::ACodec()... {mUninitializedState new UninitializedState(this);mLoadedState new LoadedState(this);mLoadedToIdl…

2026/8/24 16:16:42

智能体持续学习防遗忘机制:从EWC到经验回放的工程实践指南

在实际的人工智能研究和工程实践中,智能体(Agent)框架的设计与实现是一个核心挑战。一个理想的智能体不仅需要具备强大的初始学习能力,更需要能够在动态环境中持续学习新知识,同时避免在学习新任务时遗忘旧技能。这种能…

2026/8/24 16:16:42

从搜索到强化学习:AI导论知识整合与迷宫智能体实践

在实际学习人工智能导论课程时,很多同学会感到困惑:教材和课程视频往往按章节讲解搜索、贝叶斯网络、机器学习、神经网络、强化学习等独立概念,但学完后却不知道如何将这些知识串联起来,形成一个完整的知识体系,更不清…

2026/8/24 16:11:40

GPT-Image-2 API透明背景图像生成:从原理到工程实践

这次我们来看一个近期更新的图像生成 API 服务:GPT-Image-2。这个项目最核心的更新是增加了对生成图像“透明背景”的支持,并优化了预览功能。对于需要将 AI 生成的图像无缝集成到设计稿、UI 界面或视频合成中的开发者来说,这无疑是一个关键特…

2026/8/24 0:07:22

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/24 1:12:32

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/24 8:17:29

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/24 1:09:25

3条命令跑通LocalAI:无GPU本地AI引擎部署

3条命令跑通LocalAI:无GPU本地AI引擎部署 【免费下载链接】LocalAI LocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required. 项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI…

2026/8/24 1:09:25

AI推理性能测试怎么做:MLPerf Inference完整上手指南

AI推理性能测试怎么做:MLPerf Inference完整上手指南 【免费下载链接】inference Reference implementations of MLPerf inference benchmarks 项目地址: https://gitcode.com/gh_mirrors/inf/inference 同一个模型换一张卡,速度快多少你知道吗&a…

2026/8/24 13:42:17

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/23 6:14:43

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/23 4:22:01

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…