发布时间:2026/8/5 0:21:35
执行与评估:TAO 工具选择,与让 Agent “知道自己错在哪” 执行与评估TAO 工具选择与让 Agent “知道自己错在哪”配套课程执行层TAO ReAct 评估反馈主线。对应考点为什么选错工具、怎么判断用户喜不喜欢、怎么把失败变优化。1. 执行层TAO 不是“走一步看一步”的口号课程 08/09 讲的核心是TAO 是 Task→Action→Observation 的紧凑循环ReAct 更强调显式推理轨迹。但面试真正的坑是 09 讲标题——为什么你的 Agent 总是选错工具本系统的答案用可解释的工具选择器而不是把动作文本丢给 LLM 让它“自己看着办”。TOOL_KEYWORDS{retrieve:[检索,资料,知识,查一下],compare:[对比,比较,排序,维度,差异],calculator:[计算,算,公式,价格,费用],booking:[下单,预订,订,购买,预约],recommend:[推荐,建议,结论,引导,澄清],...}defselect_tool(action_text,available):scores{t:sum(kinaction_textforkinTOOL_KEYWORDS[t])fortinavailable}returnmax(scores,keyscores.get),scores每一步执行都打印tool_scores所以“为什么选这个工具”是可解释的[exec] TAO select toolcompare scores{retrieve:1, compare:2, calculator:1}如果 Plan 给的工具名和实际动作不匹配以打分器为准纠偏——这就是“选错工具”的解法不是不犯错而是犯错可被发现、可被纠正。2. 工具注册表Agent 的“手”exec_agent.py内置一组工具其中retrieve直接调 MemoryAgent跨机booking故意在缺参数时失败以触发 ReplanTOOL_IMPL{retrieve:_t_retrieve,# 调 memory_agent 的 RAGcompare:_t_compare,# 按“最划算”排序booking:_t_booking,# 缺 entity/destination 时返回结构化失败calculator:_t_calculator,recommend:_t_recommend,...}工具返回的是结构化结果或结构化失败不是一段自然语言——这样上层才能做根因分类和自愈。3. 评估反馈把一次运行量化成指标课程评估反馈主线的两问“用户喜不喜欢” “Agent 知道自己错在哪”eval_agent.py把一次Trace量化成 6 个可解释指标metrics{intent_accuracy:# 意图识别准确率置信度 是否澄清plan_quality:# 计划是否具备 G4C依赖图 每步预案tool_selection:# 工具选择可解释、纠偏次数retrieval_relevance:# 检索是否命中recovery_success:# 是否从失败中自愈Replan 后成功context_efficiency:# 上下文是否被有效压缩}S2 实测指标总分 0.945良好指标值intent_accuracy0.92plan_quality0.95tool_selection1.0retrieval_relevance1.0recovery_success1.0整体0.9454. 反馈闭环失败 → 根因 → 优化依据评估不只是打分还要沉淀。本系统把每次失败的类型 根因 修复动作写进看板dashboard.py并支持显式反馈点赞/点踩deffeedback(self,session_id,rating,comment):self.feedbacks.append({...})# 形成下一次优化的依据这就是课程说的把一次失败变成下一次优化的依据逐步降低同类失败率。5. 看板面试作战地图m4上的dashboard(8006)把最新一次运行的指标、全链路事件时间线、Replan 标记渲染成网页。面试时打开它指着时间线讲“这里下单失败→这里回溯根因→这里自愈”比 PPT 有说服力。6. 面试话术模板“执行层我用 TAO 循环但工具选择不靠 LLM 玄学——我有一个动作-工具打分器可解释、可纠偏。评估侧我把每次运行量化成意图准确率、计划质量、工具选择、检索相关性、自愈成功率、上下文效率六个指标并把失败按‘类型根因修复’沉淀成反馈闭环让 Agent 知道自己错在哪、下次怎么改。”下一篇面试话术与简历把项目讲专业

相关新闻

2026/8/5 0:21:35

上下文与检索:Context Window = f(Context),以及不调库的 RAG

上下文与检索:Context Window f(Context),以及不调库的 RAG 配套课程第三章(11 讲) 智能检索主线。对应考点:上下文不是越多越好、压缩与细节找回、RAG 不止于“丢给向量库”。 1. 一句话点破误区 面试官:…

2026/8/5 0:21:35

规划执行:好 Plan 的 G4C,与“失败点 ≠ 根因点”的 Replan

规划执行:好 Plan 的 G4C,与“失败点 ≠ 根因点”的 Replan 配套课程第二章(05~10 讲)。对应考点:Plan 机制、Replan 上下、TAO & ReAct、面试场景设计。 1. 面试官的两连问 面试官:你的 Agent 怎么制定…

2026/8/5 0:21:35

意图识别:面试官不想听“调大模型判断”,这三层才是答案

意图识别:面试官不想听“调大模型判断”,这三层才是答案 配套课程第一章。对应考点:用户输入规范化、三层意图识别机制、准确率提升、简历写法。 1. 面试现场最常翻车的一句话 面试官:用户说“那个最划算的帮我订了”,…

2026/8/5 1:26:44

从串口通信到LED控制:嵌入式开发入门实践与STM32项目详解

1. 项目概述:从“点灯”到“通信”的入门实践“通过串口控制LED的亮灭”,这个标题听起来简单得像是嵌入式开发领域的“Hello World”。但在我十多年的硬件调试和嵌入式开发经历里,这个项目远不止是让一个灯闪烁那么简单。它本质上是一个完整的…

2026/8/5 1:26:44

OpenClaw与LiteLLM:构建模块化AI代理的实践指南

1. OpenClaw项目概述与核心价值 OpenClaw是一个开源的AI代理框架,它允许开发者快速构建和部署基于大语言模型的智能应用。这个框架特别适合需要对接多种消息平台(如Discord)和不同AI模型服务的场景。最近在实际项目中,我发现通过…

2026/8/5 1:26:44

大语言模型长文本生成评估:基于Claude 3.5与Three.js的可视化实践

在实际的大语言模型(LLM)应用和评估中,如何有效、直观地测试其长文本生成能力,一直是开发者和研究者面临的挑战。传统的纯文本输出对比,难以直观展现模型在维持长程一致性、角色扮演和复杂叙事结构上的真实表现。近期&…

2026/8/5 1:26:44

DeepSeek V4-Flash:百倍成本降低的高效AI推理模型实践指南

这次我们来看一个在AI开源社区引发热议的项目:DeepSeek V4-Flash。它不是一个新的通用大模型,而是DeepSeek-V4模型的一个“精简版”或“高效版”。核心看点非常直接:在保持相当竞争力的推理能力(特别是代码和数学)的同…

2026/8/3 21:14:30

如何用免费工具突破游戏窗口限制:SRWE完整使用指南

如何用免费工具突破游戏窗口限制:SRWE完整使用指南 【免费下载链接】SRWE Simple Runtime Window Editor 项目地址: https://gitcode.com/gh_mirrors/sr/SRWE 你是否遇到过这样的困扰?想为心爱的游戏截图,却发现游戏不支持自定义分辨率…

2026/8/5 0:01:34

三升四,比成绩下滑更可怕的,是孩子开始「认命」

分水岭上,最难的不是翻过去,是孩子不想翻了。八月初了。这两个字,对三升四的家长来说,比任何闹钟都让人清醒。最近的家长群里,气氛明显不一样了。一升二的在关心兴趣班,二升三的在讨论要不要提前学英语。而…

2026/8/5 0:01:34

Java缓存框架:JetCache

TOC 一、简介 JetCache 是一个 Java 缓存抽象框架,为不同的缓存解决方案提供了统一的使用方式。 它提供的注解比 Spring Cache 更加强大。 JetCache 的注解支持原生 TTL、两级缓存以及在分布式环境中的自动刷新功能,同时你也可以通过代码直接操作 Cach…

2026/8/5 0:01:34

AD 铺铜设置十字连接,过孔全连接,新版AD的简单设置

需求:通孔焊盘 十字花;过孔 Via 实心直连;贴片焊盘按需设置 AD 测试版本AD24 很多工程师踩坑:全部统一十字,导致接地过孔阻抗高、大电流发热! 一、快捷键打开规则 PCB 界面按下:D R 展开…

2026/8/3 22:40:58

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/3 13:26:41

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/3 16:43:13

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…