Agent 评测的数据飞轮:如何把 Good Case 和 Bad Case 变成回归资产

发布时间:2026/10/5 17:46:34

Agent 评测的数据飞轮:如何把 Good Case 和 Bad Case 变成回归资产 个人主页zzz_2368 系列主题Agent 评测从结果、轨迹到持续迭代 热门专栏Agent | 小z的碎碎念 | Java后端 本系列内容评测体系、Rubric、Good Case、Bad Case、Trace 与长程 Agent系列第 3 篇上一篇如何从 0 搭建 Agent 评测体系本文参考《Agent 评测漫谈》、OpenAI Evals 和 Anthropic 的 Agent 评测文章。本文不声称拥有真实生产数据示例中的任务和字段是用于说明流程的抽象示例。一、为什么平均分不够用一个 Agent 的总体通过率是 90%听起来不错但这个数字可能掩盖了三种完全不同的情况低风险任务稳定通过高风险任务偶尔越权所有任务都小幅波动没有明显短板常见任务表现很好但少数关键客户任务全部失败。因此评测结果不能只保存一个总分。至少还要保留任务类型、失败原因、风险等级、执行版本和相关 Trace才能回答“哪里变差了”。二、从线上问题到评测样本一个 Bad Case 不应只是截图或一句“效果不好”。建议整理成结构化记录case_id:support-2026-001source:production-feedbacktask:用户要求取消订单并查询退款进度input_context:已登录订单状态为配送中observed_result:Agent 只解释了退款规则没有执行查询expected_behavior:-识别查询与取消两个子任务-先确认取消操作的风险-返回真实订单状态failure_category:planningseverity:mediumregression:true这里要区分三个概念现象用户看到了什么根因假设可能是规划、工具、权限、上下文还是评测规则问题回归标准下一次怎样证明问题已经修复。如果只有现象没有成功标准样本就很难进入自动回归。三、Good Case 和 Bad Case 各自解决什么问题Bad Case 用来暴露能力边界和系统短板例如工具参数错误、循环调用、权限越界和最终状态不一致。Good Case 则用来定义“什么叫高质量完成”。它不只是用来展示 Demo也可以帮助团队明确哪些步骤是必要的哪些额外解释是有价值的哪些简化路径可以接受哪些结果虽然正确但成本过高。需要注意Good Case 不等于唯一标准答案。对于复杂任务可能存在多条满足约束的成功路径。评测更适合检查必要条件、禁止条件和最终状态而不是强制 Agent 复刻某一条轨迹。四、一个可执行的数据飞轮可以把闭环分为六个阶段采集 - 清洗与脱敏 - 标注成功标准 - 执行与评分 - 失败归因 - 回归与发布门禁 ↑ ↓ └── 新的线上 Case ──┘1. 采集来源可以包括线上 Trace、用户反馈、人工抽检、客服升级和开发测试。采集时应保留必要上下文但不能为了方便把密钥、个人信息或完整业务数据直接复制进公共评测集。2. 清洗与脱敏处理重复样本、无效输入、缺失上下文和敏感字段。脱敏不能破坏任务语义。例如订单号可以替换成稳定的占位符但订单状态关系仍要保留。3. 标注成功标准把用户的自然语言诉求转成可检查的expected_behavior、outcome和约束条件。Anthropic 的 Agent 评测说明将任务、试验、评分器、记录和结果分开描述这种拆分很适合用来设计样本字段。参考原文。4. 执行与评分确定性规则优先例如最终状态、Schema、权限和文件存在性语义质量再使用人工或 LLM Judge。不要让一个模糊的总分遮住确定性失败。5. 失败归因建议至少设置以下分类分类例子规划没有拆分依赖任务工具参数错误、没有处理错误返回上下文读取了错误或过期信息环境沙箱、网络或外部系统不可用Skill/Prompt规则缺失或表达冲突评测成功标准本身不清楚最后一类很重要。若大量评测员无法判断问题可能不在 Agent而在评测集设计。6. 回归与发布门禁模型、Prompt、Tool、Skill 或编排逻辑变更后重新执行历史样本。对高风险任务可以把“任何越权失败”设为阻断条件对低风险语言风格可以设置观察阈值。门禁应该和风险等级绑定而不是所有指标都采用同一阈值。五、评测集也会老化评测集不是永久真理至少有四类老化风险样本被反复优化Agent 只学会了固定套路用户分布变化旧样本不再代表真实流量工具和业务规则变化旧成功标准失效评测样本过于简单无法发现长尾失败。所以应保留训练集、回归集和探索集的边界定期检查样本覆盖面。对于尚未稳定的业务不要只追求历史回归分数上涨还要保留一部分新任务用于发现未知问题。六、结论数据飞轮的核心不是“收集更多案例”而是把案例转成可执行、可复现、可归因的评测资产线上现象 → 结构化 Case → 成功标准 → 评分 → 根因 → 修复 → 回归。OpenAI Evals 提供了面向 LLM 和 LLM 系统的评测框架思路但具体数据字段和门禁标准仍要由业务场景决定。真正成熟的体系应该能让一次线上失败减少下一次同类失败的概率。下一篇将进一步讨论如果没有完整 Trace为什么很多归因只能停留在猜测。一个 Bad Case 如何进入回归本地 Demo 使用 order-query-empty-result 作为模拟 Bad Case版本结果失败归因v1失败tool-error-handlingv2通过已增加工具空结果的失败分支运行本地 Demo可以得到这组结果。重点不是版本号或成功率而是把“工具返回空结果后 Agent 没有处理”从一次现象变成可重复的回归样本。七、回归资产的发布门禁一个新 Case 是否进入正式回归集可以用以下门禁判断输入上下文已经脱敏且可重放预期行为和最终状态已经定义至少有一个确定性 Grader失败归因不是空值该 Case 能说明一个真实风险或能力边界。修复后的版本不能只在新增 Case 上通过还应重新运行历史回归集并检查是否引入新的工具调用、成本或安全问题。若业务规则发生变化应给样本标记版本不要静默修改旧标准。数据飞轮的成功标准不是“Case 数量越来越多”而是失败能够被复现、修复能够被验证、历史问题能够被持续拦截。参考资料《Agent 评测漫谈》AnthropicDemystifying evals for AI agentsOpenAI Evals GitHub 仓库感谢阅读记得点赞、关注、收藏欢迎各位评论区交流
延伸阅读

更多相关文章

2026/10/4 20:07:52

同城中台系统核心表设计与模块启用状态机(代码深讲)

县城创业者评估「同城中台系统」时,技术侧常纠结功能捆绑:是否必须一次启用全部业务域?下文用模块注册表、启用状态机与 Service 伪代码说明「统一中台 按需启用模块」如何落地,并给出低成本试水期的联调验收点。示例为教学示意。…

2026/10/5 17:46:26

哪款远控最适合个人长期使用?5款工具盘点,向日葵不限时长次数

先说结论:对于大多数个人用户来说,向日葵是目前是更有性价比的选择。它在连接稳定性上做到了跨运营商延迟20ms以内、极少掉线;在功能完整性上覆盖了远程开机、AI远控、超级桌面、闪传等丰富功能;在免费政策上真正做到了不限时长不…

2026/10/3 22:53:57

2026远程控制软件横评:向日葵、ToDesk、UU远程谁更值得选?

先说结论:本次测试跨时9天,分别从CAD远控画质、免费功能权益、1Mbps极限弱网三个维度实测对比。综合来看,如果用户希望获得稳定连接、完整免费功能与弱网可靠性的远控体验,那么向日葵是更加合适稳妥的选择。写在前面远程控制软件已…

2026/10/5 17:43:01

果蔬机械采摘中的计算机视觉:难点与工程实践

简介:面向农业自动化、机器视觉与智能农机领域的研究人员和工程技术人员,这是一篇关于计算机视觉在果蔬机械采摘中应用研究的PDF参考文献。资源共1个PDF文件,压缩包大小仅1.35MB,内容为完整学术论文,涵盖计算机视觉系统…

2026/10/5 17:43:01

Go电商系统实战:Gin+MongoDB+Redis高并发架构解析

简介:本资源是一套基于Go语言的B2C电商系统实战源码,面向具备Go基础的中高级开发者,聚焦Web后端开发、高并发架构与微服务实践,助力快速掌握电商核心模块(如用户中心、商品管理、订单服务)的工程化落地。压…

2026/10/5 17:43:01

本地部署图文视频生成网站:ComfyUI+FastAPI全流程搭建教程

简介:这是一份面向AI绘画爱好者的本地化图文视频生成网站搭建教程PDF,适合想掌握开源图像生成工具部署、摆脱在线服务限制的读者。教程从Python环境配置开始,逐步讲解项目代码拉取、GPU版PyTorch安装,再到模型下载与真人模型放置&…

2026/10/5 17:43:01

Stata中多层线性模型(HLM)从空模型到随机斜率的完整实操指南

后台经常有人问我,Stata到底能不能做HLM?当然能,而且从命令成熟度和输出友好度来看,Stata可以说是做多层线性模型最顺手的工具之一。HLM(多层线性模型)在Stata中对应的一套语句,核心就是mixed命…

2026/10/5 17:43:01

CBAM注意力机制:通道与空间注意力模块全面解析

大概2018年那会儿,图像分类网络的性能拼到了一个阶段后,大家开始琢磨:除了把网络做得更深、更宽,还有没有别的路可以走?注意力机制就是在这个背景下被推上舞台的。CBAM,全称Convolutional Block Attention …

2026/10/5 17:38:00

OrCAD PSpice 9.2安装与License配置全攻略:含Win10/11及虚拟机避坑指南

装到一半弹错、授权文件翻来覆去配置、启动后闪退……如果你最近也在为OrCAD PSpice 9.2的下载安装问题焦头烂额,那我特别理解你的处境。这个版本在EDA圈子里流传了二十多年,网上能找到的安装包来源各异,教程也是各说各话:有人说必…

2026/10/5 6:32:56

Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化

1. 从“Jev”说起:为什么我要把Agent接进浏览器“Jev”这个词最近在圈子里出现的频率越来越高,很多人第一次听到会以为是某个新模型的名字,其实它更像是一种思路——把Jev模型的能力当作底座,通过Agent的方式去接管浏览器&#xf…

2026/10/4 0:01:02

多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系

1. 从"单兵作战"到"集群协同":多智能体编排到底在解决什么问题如果你最近在折腾 Agent 相关的东西,大概率会有一种感觉:单个 Agent 能做的事情,其实很快就摸到天花板了。你给它一个提示词,挂几个工…

2026/10/5 17:38:27

无源低通滤波器设计实战:从RC到LC,手把手教你避开那些坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑