发布时间:2026/9/2 6:59:13
【Day 11】Agent做错了怎么办?让它自己检查 摘要try-except只能捕获代码崩溃发现不了逻辑错误。本文实现Reflexion模式执行后LLM自我评估不通过则反思错因并存入记忆带着反思重试。核心约80行免费运行。你让Agent算购物总价3本书每本45元、2支笔每支12元、1个书包88元。它调了calculate(3*452*12)返回159。代码没报错工具也调对了但结果是错的——漏了书包的88元3×452×12159加上书包才是247。try-except在这种情况下完全没用因为程序层面一切正常错的是逻辑。人遇到这种情况会怎么做做完检查一遍发现不对想想哪里错了重新算。Reflexion模式就是让Agent学会这件事。四步闭环Reflexion的思路特别朴素就四步循环通过不通过1.执行 Act选工具、传参、跑2.评估 EvaluateLLM检查结果对不对返回结果3.反思 Reflect错在哪下次怎么改反思存入记忆4.重试带着反思记忆重新执行关键在第三步和第四步之间反思不是用完就扔而是存进记忆下次执行时一起传给LLM。这样它不是盲目重试而是知道上次为什么错了换个方式。核心代码ReflexionAgent只有三个核心方法对应执行、评估、反思importjsonfromllm_clientimportLLMClientclassReflexionAgent:def__init__(self,max_attempts3):self.llmLLMClient(providerglm)self.max_attemptsmax_attempts self.reflections[]# 反思记忆跨尝试累积def_act(self,task):执行选工具并调用。如果有反思记忆附加到system prompt里systemTOOL_PROMPTifself.reflections:system\n之前的反思避免重复犯错\nfori,rinenumerate(self.reflections,1):systemf{i}.{r}\nrespself.llm.chat_json(f任务{task}\n选工具完成。,system_promptsystem,temperature0.1)decisionjson.loads(resp)returnexecute_tool(decision.get(tool),decision.get(args,{}))def_evaluate(self,task,result):评估让LLM判断结果对不对promptf评估执行结果是否正确完整。 任务{task}结果{result}返回JSON{{passed: true/false, reason: 理由}}returnjson.loads(self.llm.chat_json(prompt,temperature0.1))def_reflect(self,task,result,eval_result):反思分析错因生成改进策略promptf任务执行失败分析原因并给出改进建议。 任务{task}结果{result}失败原因{eval_result.get(reason)}用2-3句话总结错在哪下次怎么做不要JSON。returnself.llm.chat(prompt,temperature0.3)defrun(self,task):forattemptinrange(1,self.max_attempts1):print(f\n── 第{attempt}次尝试 ──)resultself._act(task)evaluationself._evaluate(task,result)ifevaluation.get(passed):print(f✅ 第{attempt}次通过)returnresult reflectionself._reflect(task,result,evaluation)self.reflections.append(reflection)print(f❌ 未通过 → 反思{reflection[:80]}...)returnresult# 达上限仍未通过返回最后一次结果max_attempts3防止死循环。真正起作用的是self.reflections列表——第一次失败后反思被追加进去第二次执行时LLM能看到第一次的反思不会在同一个坑里摔两次。工具注册和执行部分保持简单importdatetime TOOLS{calculate:{func:lambdaexpr:str(eval(expr)),desc:数学计算参数expression为算术表达式,},get_time:{func:lambda:datetime.now().strftime(%Y-%m-%d %H:%M:%S),desc:获取当前时间无需参数,},}TOOL_PROMPT可选工具\n\n.join(f-{n}:{t[desc]}forn,tinTOOLS.items())TOOL_PROMPT\n返回JSON{tool:名,args:{}}defexecute_tool(name,args):ifnamenotinTOOLS:returnf未知工具:{name}returnTOOLS[name][func](**args)真实运行过程agentReflexionAgent(max_attempts3)resultagent.run(计算购物总价3本书每本45元2支笔每支12元1个书包88元。用calculate工具。)第一次尝试LLM写的表达式漏了书包── 第1次尝试 ── tool: calculate args: {expression: 3*452*12} 结果: 159 评估: ❌ 不完整。漏了书包的88元3×452×12159加上书包应为247。 反思: 表达式漏了书包应该写成3*452*1288结果才是完整总价247。第二次尝试反思记忆被传入LLM看到了上次错在哪── 第2次尝试 ── tool: calculate args: {expression: 3*452*1288} 结果: 247 评估: ✅ 正确。1352488247。 第2次尝试通过说明上面是第一次漏项→反思→补全的典型流程示意。实际运行时 LLM 也可能第一次就写对比如直接给出完整表达式3*452*1288247此时评估直接通过、不进入反思——反思只在结果不对时才触发。注意第二次的system prompt里多了一段之前的反思避免重复犯错 1. 表达式漏了书包的88元应该写成3*452*1288...这就是Reflexion和简单重试的本质区别。简单重试是把同样的事情再做一遍大概率还错Reflexion是带着经验教训做错一次学一次。实际运行效果try-except和Reflexion的区别维度try-exceptReflexion发现什么代码崩溃、异常逻辑错误、结果不对怎么处理捕获异常、返回错误信息LLM分析原因、生成改进策略重试方式原样重试或跳过带反思记忆重试换策略能发现除零、文件不存在算错数、选错工具、参数语义错两者不是替代关系。try-except兜住代码层面的崩溃Reflexion兜住逻辑层面的错误。完整版里两者配合使用工具函数内try-except防崩溃Agent外层Reflexion检查逻辑。完整版包含5个工具、置信度判断简单错误不浪费反思、人工确认机制、反思停滞检测连续两次反思相同则提前终止放在CSDN下载区。GLM-4.7-Flash永久免费200K上下文注册地址https://open.bigmodel.cn/下一篇Day12讲工具生态每加一个工具就要改代码重启用注册中心实现插件化。本文由「梅雅达编程笔记」原创首发CSDN。AI Agent实战系列共18篇从Function Calling到多Agent协作全程用免费模型GLM-4.7-Flash点个关注不迷路✨CSDN博客https://blog.csdn.net/2601_96428997/

相关新闻

2026/9/2 6:59:13

Android条码扫描Demo:集成CameraX与ML Kit实现

简介:面向Android开发者的条码扫描集成示例,基于ZXing开源库,附带完整可运行的扫码项目。Demo覆盖从相机预览、条码检测到解码返回的完整链路,支持QR码、Code 128、EAN-13等多种格式,适合需要在App中快速落地扫码功能的…

2026/9/2 6:54:13

STM32C5A3R GPIO驱动LED:从硬件原理到模块化代码的嵌入式开发入门

最近在整理一些嵌入式开发的基础项目,发现很多新手在拿到一块开发板后,第一件事就是点亮LED。这看似简单,但真正能把这件事做“透”的人并不多。很多人只是照着教程复制代码,灯亮了就觉得任务完成,却忽略了背后关于硬件…

2026/9/2 7:14:14

用Claude Code搭建农业物联网监测平台:完整实战指南

Claude Code 的 100 个实战案例中,农业物联网监测平台是很有代表性的一种。它并不是让 AI 单纯生成几个页面,而是涉及传感器数据采集、协议解析、存储建模、接口服务、告警计算和可视化展示的完整链路。把这条链路交给 Claude Code 来辅助搭建&#xff0…

2026/9/2 7:14:14

超迷你DC-ATX电源:小机箱空间利用与供电改造完全指南

这次我们来看一个能直接改变小机箱内部布局的电源方案:超迷你 DC-ATX 电源。它的体积往往只有一张名片大小,甚至“手指大小”,却能输出上百瓦功率,把传统 ATX 电源挤出机箱之外。对于折腾 ITX、A4 结构、NAS、软路由、HTPC 的玩家…

2026/9/2 7:14:14

C语言医院挂号系统实战:链表与文件操作的综合应用

简介:本资源是一个基于C语言开发的轻量级医院挂号系统实现,面向C语言初学者与课程设计实践者,旨在通过真实业务场景帮助学习者掌握结构体设计、链表管理、文件持久化及模块化函数开发等核心编程能力。压缩包为ZIP格式,大小56KB&am…

2026/9/2 7:14:14

基于知识图谱与推荐系统的药物靶点预测:从数据到AI模型实战

简介:本资源是一套面向计算机及相关专业本科生的课程设计与期末大作业实战项目,聚焦于生物信息学交叉场景——利用知识图谱与推荐系统协同预测药物-靶点相互作用。项目代码完整、结构清晰,涵盖数据预处理(如hetionet.py、yamanish…

2026/9/1 16:02:17

vSound小提琴数字处理器实操指南:从接线到演出的完整配置

电小提琴或者原声小提琴插电演出,第一个绕不开的坎就是声音难听。原声琴的共鸣和空气感一旦进了拾音器,出来的往往是一坨干瘪、发尖、带着奇怪塑料味的信号。我当初第一次把琴接上乐队调音台,直接被主唱吐槽"你这声音像在锯钢丝"。…

2026/9/1 8:27:47

传感器接口IC如何攻克生物化学传感的微弱信号难题?

1. 从电极到比特流:为什么生物化学传感必须依赖专用接口IC 做生物化学传感的人都有过类似的经历:明明传感器本身性能很好,信号输出却一塌糊涂——噪声大、漂移明显、重复性差,怎么调都达不到预期。很多时候问题并不在传感器&#…

2026/9/1 7:04:43

STM32F411CEU6多通道ADC采集:扫描模式+DMA实现详解

1. 多通道 ADC 的用武之地把“Multichannel ADC”和“STM32F411CEU6”这两个关键字放在一起,其实就是嵌入式开发里最常遇到的一类需求:用一块不算贵的 MCU,同时采集多路模拟信号。STM32F411CEU6 是 48 引脚的 Cortex-M4F 主控,主频…

2026/9/2 0:03:41

单片机毕业设计-基于单片机与蓝牙通讯的输液状态监测终端设计与开发 基于 STM32 或 51 单片机的液位‑滴速‑温度多参数输液监护装置设计(024005)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于嵌入式单片机,Java、小程序技术领域和毕业项目实战 ✌️…

2026/9/2 0:03:41

DeepSeek字幕翻译实战:从API调用到批量SRT转中文的完整方案

这次我们来看一个很实用的 DeepSeek 落地场景:用 DeepSeek 把英文视频字幕自动翻译成中文。具体案例是《恶魔君》1989 年第 28 集的英转中字幕任务,标题写得很直白,但背后其实是一整套可以复用的技术流程:字幕解析、模型调用、批量…

2026/9/2 0:03:41

用Python搭建搞笑语音助手:从语音识别到语音合成全教程

当你家里摆着一台天猫精灵,却总希望语音助手偶尔“不正经”一点,不用官方腔回答问题,而是张口就接几句搞笑段子,会是什么体验?我最近动手验证了一下这个想法——没有去改装任何市面上现有的智能音箱,而是直…

2026/9/2 1:15:22

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/2 1:15:22

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/2 1:15:20

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…