
随着AI智能体在企业中的应用普及如何大规模稳定地运行它们成为关键挑战。本文聚焦智能体可观测性层探讨如何利用OpenTelemetryOTel记录关键属性实现端到端追踪、性能与成本优化、审计与治理以及持续改进。文章详细介绍了智能体AI参考架构、可观测性范围与能力、OTel日志实现原则与属性建议并展示了基于OTel的智能体评估与FinOps架构帮助开发者有效监控、评估和管理智能体AI系统。1. 引言Harness 是智能体 AI 世界的新热词。随着 AI 智能体在企业中逐渐普及开发智能体已经变成了容易的那部分真正难的是如何大规模、稳定地把它们跑起来。对那些真正在企业里构建智能体 AI 系统、并在大规模场景中应用软件工程最佳实践的人来说这个趋势并不意外。虽然 Anthropic 最早是在 智能体代码编写 的语境下提出这个概念的但它同样适用于任何智能体设计。核心假设是关注点已经从 LLM 本身转移到围绕 LLM 构建一个有效的 Harness让智能体执行过程可以被可靠且负责任地管理。这就是从孤立的智能转向可管理的执行的过程。关键构建模块包括如图 1 所示推理循环生成计划图结构执行反思循环/调整直到完成目标功能。上下文记忆管理优化上下文在存入短期记忆STM前先总结并把 STM 内容转化为长期记忆LTM。评估Evals利用LLM 担任裁判来评估响应质量和智能体输出必要时使用基准真值。护栏Guardrails防范攻击例如提示词注入、智能体/工具滥用、记忆投毒。人在回路HITL让人成为智能体生命周期中的一等公民不只是监督者提供支持交互和干预的合适界面。本文聚焦于智能体 可观测性 层这一层对监控和管理各个 Harness 组件至关重要。第 2 节先定义智能体可观测性层的范围、能力和局限。第 3 节定义启用溯源与可观测所需记录的 OpenTelemetryOTel属性。最后第 4 节和第 5 节分别展示可观测性层如何用于评估和 FinOpsAI 财务运营——作为持续改进的手段识别功能效率和成本效率的提升空间。2. 智能体 AI 可观测性2.1 智能体 AI 参考架构下图 2 展示了智能体 AI 平台的关键组件这些组件构成了第 2.2 节可观测性层的基础推理层分解复杂任务自适应地调整执行以实现目标智能体市场/注册表管理现有可用的智能体、工具和模型编排模块编排并监控观测多智能体系统的执行集成模块通过 MCP 工具连接企业系统如 ERP、CRM、知识库供智能体间数据与上下文共享的 共享记忆管理治理层包括可解释性、隐私、安全、安全护栏等。给定一个用户任务智能体 AI 平台的目标是找到组合出一个能执行该任务的智能体或智能体组。因此第一个需要的是能把任务分解为子任务的推理模块由编排引擎来协调各智能体的执行。目前最广泛使用的分解框架是思维链CoT它把复杂任务拆成多个可管理的小任务并呈现出模型思考过程的解释。此外ReAct推理与行动框架让智能体能批判性地评估自己的行动和输出从中学习并随后优化推理和计划流程。智能体的组合需要一个智能体市场/注册表其中有对智能体能力和约束的清晰描述。例如Agent2AgentA2A协议提出了智能体名片Agent Card概念一个 JSON 文档作为智能体的数字名片包含以下关键信息Identity: name, description, provider information. Service Endpoint: The url where the A2A service can be reached. A2A Capabilities: Supported protocol features like streaming or pushNotifications. Authentication: Required authentication schemes (e.g., Bearer, OAuth2) to interact with the agent. Skills: A list of specific tasks or functions the agent can perform (AgentSkill objects), including their id, name, description, inputModes, outputModes, and examples.由于需要编排多个智能体需要一个系统集成层支持不同的智能体交互模式如智能体间 API、智能体输出供人消费、人触发 AI 智能体、带人在回路的 AI 智能体间协作等。这些模式需要底层的智能体 OS 平台来支撑。Anthropic 近期提出的模型上下文协议MCP用于将 AI 智能体连接到企业数据所在的外部系统/工具。MCP 被称为 AI 模型的USB-C通过三个核心构建模块实现互操作资源、提示词和工具。通过标准化这些内容任何使用 MCP 的 AI 系统都能理解如何通过任何兼容的 MCP 服务器请求数据资源、提供指令提示词或执行操作工具。由于复杂智能体任务通常是长时间运行的记忆管理对智能体 AI 系统来说非常关键。这包括任务间的上下文共享以及在较长时间内维持执行上下文。标准做法是将智能体信息的向量嵌入存入向量数据库支持最大内积搜索MIPS。为实现快速检索通常使用近似最近邻ANN算法用一定准确率换来巨大的速度提升。最后是治理层。我们需要确保用户针对特定任务共享的数据或跨任务的用户档案数据只与相关智能体共享表/报告的鉴权与访问控制。2.2 智能体 AI 可观测性智能体 AI 系统如上所述通常涉及编排多个智能体、工具和模型LLM产生不确定性的决策路径。因此智能体可观测性对以下方面至关重要对智能体、工具、模型LLM、用户、上下游应用的端到端追踪——如图 3 所示。对 LLM 使用情况、故障、幻觉、延迟峰值、成本超支等的因果分析——进而实现性能和成本优化。支持可审计性与治理提供不可篡改的溯源记录、安全护栏证据以及多智能体流水线的成本用量归因。支持持续改进让工程团队能够在有验证指标的情况下迭代提示词、智能体逻辑和策略。还需特别强调智能体可观测性横跨构建时可观测性和运行时可观测性两个阶段——如图 4 所示。构建时可观测性专注于在系统部署前分析其代码、配置和产物——在开发周期早期发现问题检查构建或部署阶段的合规性和潜在问题。在智能体场景下这意味着校验智能体流水线各组件的结构和设计相关指标以及来自模拟或测试运行的功能与性能数据。运行时可观测性通过生产环境中的日志、指标和追踪等数据实时了解系统运行时的行为、性能和错误。在智能体场景中由于运行的不确定性运行时可观测性更为重要。运行时可观测性是持续监控和确保智能体行为与预期目标保持一致的必要手段尤其是当智能体有能力自主改变目标或计划时。最关键的对齐风险如目标漂移或递归死循环是动态涌现的仅靠构建时配置无法完全控制。3. OpenTelemetryOTel日志本节深入介绍实现上述智能体可观测性能力所需的 OpenTelemetryOTel属性。设计原则规范标准优先以 W3C 追踪上下文traceparent、tracestate作为主要传播格式避免各类私有 header 泛滥。一个任务锚点多个 Span将AI 任务视为锚定到一个追踪trace的逻辑操作模型/工具调用是子 Span重试作为同一 trace 中的新 Span。链接而非分叉用 OTel “links” 表示事件流中的扇出/扇入、定时工作和跨追踪的汇聚。ID 零语义ID 是不透明的、全局唯一的、不可猜测的——语义应体现在属性中。目标是确定每个智能体流水线都必须记录、存储和共享的最小可移植属性集。必要的标识符规范包括trace_id跨运行的任务/全局关联span_id任务内部的操作parent_span_id因果关系links[]非层次化因果关系扇出/扇入、定时建议使用trace_id作为跨系统和平台的 AI 关联 ID。AI 特定的标准属性如下表所示。这些属性需要添加到相关 Span使智能体流水线可审计——实现带溯源的追踪。属性名称仅供参考可映射到 OTel 智能体 AI 语义约定待最终确定。4. 智能体评估与优化指标是定量评估的关键用于衡量智能体实现目标的程度、错误检测能力和工具选择的有效性。它们对评估智能体用例的性能和效率至关重要。4.1 智能体效率这些指标衡量智能体工作流的效率。推理相关性确保智能体的推理与用户查询保持一致。每次工具调用背后的推理是否与用户的需求明确关联推理连贯性检查智能体推理的逻辑流程。推理是否遵循逻辑的、循序渐进的过程每一步都应该有所增益并在任务上下文中有意义。答案相关性回答是否与输入相关事实依据性评估智能体响应在多大程度上基于可核实的、与上下文相关的事实来源最大程度降低幻觉和错误信息。响应流畅度评估智能体响应的可读性、语法正确性和自然度。响应连贯性衡量智能体的响应是否逻辑清晰并在整个对话中保持清晰。任务分解规划效率衡量智能体将复杂任务拆解为可管理子任务的能力。智能体健壮性衡量智能体在保持性能和可靠性的同时处理意外输入、错误和对抗性场景的能力。智能体一致性衡量智能体在面对相似输入的多次交互中产生稳定、可重复且逻辑连贯响应的能力。4.2 工具使用效率这些指标评估 AI 智能体选择和使用工具的有效程度。工具选择准确性衡量智能体为给定任务选择最合适工具的有效性。工具使用效率衡量智能体使用所选工具的最优程度考虑不必要的调用和资源使用等因素。工具调用精确性衡量工具调用中使用的参数的准确性和合理性。工具调用成功率总体工具调用的成功率。4.3 基于 OTel 的实现架构指标评估有两种类型离线开发阶段和实时作为可观测性/监控的一部分。在基于日志的离线评估中组件规划器、智能体和工具以特定格式生成包含特定信息的日志。基于日志的评估器审查日志并根据内容生成评估结果。这是一种非侵入式评估方法。在实时评估中组件向评估服务发起调用并发送所需产物。评估服务汇总端到端执行的所有数据实时生成评估结果。该方法需要在组件代码中嵌入实时调用并需要与智能体/工具开发团队协调。图 5 展示了基于 OTel 的离线智能体评估解决方案架构——步骤如下步骤 1触发评估。 用户通过调用 Evaluate API 启动流程所需输入包括智能体名称工具描述所选指标如工具选择准确性、推理相关性日期范围步骤 2检索交互记录。 系统根据智能体名称和提供的日期范围查询日志数据库获取相关的历史交互记录用于评估。步骤 3评估处理。 评估引擎使用LLM 担任裁判分析检索到的交互。它为每个所选指标计算得分并为这些得分生成理由说明。评估结果随后安全存储在 BLOB 存储中以持久化。步骤 4发布结果。 用户可通过以下方式查看评估结果Get ResultList API显示智能体所有评估的汇总列表。Get ResultDetails API提供每次交互和每个指标的详细得分及其理由说明。5. 基于 OTel 的智能体 AI FinOps智能体 AI 的 FinOps 可定义为一种将财务、工程和业务结合在一起的最佳实践——通过最大化价值和确保财务问责制来管理智能体 AI 成本。它通过数据驱动的洞察来管理灵活性、治理、成本与 ROI 之间的权衡帮助企业通过资源合理调整和高效分配主动优化 AI 支出。在典型智能体 AI 场景中成本通常由以下部分组成计算基础设施模型大语言模型LLM/ 小语言模型SLM存储记忆、用于搜索的向量数据库等以一个参考场景为例以 LangGraph 作为智能体开发框架部署在 Azure Kubernetes ServiceAKS上LangGraph 编排智能体执行通过内部 API 或托管运行时。智能体以自定义逻辑或工具的形式作为容器化智能体端点部署在 AKS 上。AI Search 索引企业数据向量 文本作为检索增强生成RAG的知识源。AKS Pod 调用 AI Search 和/或模型端点如 Azure OpenAI GPT 或 Azure Foundry 中微调的 LLM/SLM。OpenTelemetry 日志如第 3 节所述存储在带 Application Insights 的 Azure Monitor 中。成本计算需要考虑以下参数——基于 AKS Pod 的读写、搜索查询延迟同时运行多少个智能体 Pod平均智能体容器镜像大小约为每个智能体 2–4 GB × 并发会话数。AKS 中暂存或缓存了多少个 LLM/检查点这里的平均值约为 1–10 GB分词器、本地权重、嵌入缓存。AKS ↔ AI Search / AI Foundry 之间的流量和延迟目标 200 ms。向量存储方面存储在 AI Search 中的嵌入大小根据用例可在 100 MB 到 100 GB 之间变化。日志量约为每 100 个会话每天 100 MB。对于 5 个并发运行的智能体代表性的容量数据如下5 个 Pod × 每个 2 vCPU × 6 GB RAM → 共 10 vCPU、30 GB RAM每个 Pod 缓存 5 GB → 25 GB 临时 SSD每天产生 1 GB 日志 → 每天 10 GB 遥测数据向量数据约 25 GB存储在 AI Search 中上述内容侧重于理解智能体基础设施成本下一节将重点分析 LLM 调用——因为它仍占整体智能体系统成本的大头。6. 结论尽管智能体 AI 系统的价值显而易见但它们是复杂系统难以可靠地管理。因此对多智能体流水线包括多个智能体、工具和 LLM 调用的端到端可观测性对企业采纳来说至关重要。为此我们提出了一个全面的智能体可观测性层涵盖构建时和运行时可观测性。有效的日志记录是实现这一切的关键我们就 OpenTelemetryOTel智能体 AI 语义约定提出了建议明确了智能体、工具、模型、安全和治理的相关 OTel 属性。最后我们展示了如何利用 OTel 日志进行智能体评估和 FinOps——实现成本和性能效率的双重提升。智能体 AI 可观测性仍处于早期阶段但发展非常迅速随着智能体开始执行更长的任务带记忆、在多智能体场景中协作使用工具、处理日益复杂的工作流建议尽早开始并以可适应变化的方式构建可观测性层——而不是试图一步到位地构建一个面向未来的可观测性平台。最后2026 年一晃已经过半AI 大模型的热潮不仅没有降温反而持续升温金融行业用大模型做风控、医疗依靠 AI 解析影像电商、制造、教育各行各业都在把 AI 融入日常业务。曾经热闹的 “百模大战”早就告别单纯比拼模型参数正式进入落地应用时代。现在企业疯狂紧缺一类人才懂业务、懂 AI、能做出可上线项目的大模型开发工程师岗位缺口大薪资待遇十分可观。风口再好不如手握高薪 offer 实在。行情火热普通人、程序员该怎样从零入门大模型抓住这波机会今天整理好【2026 最新版】AI 大模型全套免费学习资源覆盖零基础入门、项目实战、理论知识、大厂面试从基础一路进阶。所有资料分类归档没有多余杂料无套路免费分享给想要入局 AI 赛道的程序员与零基础小白扫码免费领取全部内容1、大模型系统化完整学习路线2、大模型经典书籍文档3、AI 大模型最新行业研究报告4、企业级实战项目 完整配套源码5、大厂大模型面试真题汇总6、这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】