发布时间:2026/7/23 15:32:07
用老祖宗的智慧根治大模型幻觉 相信大家在使用 GPT、Claude、DeepSeek 这些模型时一定碰到过幻觉问题。尽管语言模型能力日益增强但「幻觉」现象始终是难以彻底解决的顽疾。最可怕的是它总能给你一个答案。不管信息够不够它很少主动停下来。答案有背景、有术语推导看起来也很完整。结果一核对论文不存在版本号是编的连链接都打不开。这种看起来合理实际却是错误或无法验证的内容就是大模型幻觉。它不会像代码报错那样给你一个红色提示还可能把真资料和假结论混在一起。我们又很容易把「有答案」误认为「它知道答案」。为什么会这样LLM 的预训练是在预测下一个token。它学的是「接下来出现什么最合理」不是「这句话有没有经过事实验证」。监督微调和偏好对齐能减少错误但如果评测更喜欢完整答案模型还是会倾向于猜一个。所以解决幻觉不能只靠一句「请准确回答」。还得让模型知道什么时候该停什么时候该找证据。后来我想到《论语·为政》里的一句话把它写进了 Agent 的soul.md。知之为知之不知为不知是知也。效果竟然相当不错。它没有告别幻觉但碰到证据不足的地方开始愿意说明缺了什么请我确认。不得不佩服老祖宗的智慧。先把边界说清楚Agent 遇到陌生内容就直接拒答同样没法干活。这句话管的是回答边界。我希望它继续查也可以根据现有资料往下推但要说清楚依据。有资料直接支撑的算确定事实资料不完整但推导说得通的算逻辑推断找不到依据的只能算猜测需要把问题交还给人。不是闭嘴是别装懂。为什么它总能接着编预测下一个 token 只是原因之一。LLM 还要经过监督微调和偏好对齐而人类偏好也不总是指向事实。Sharma 等人的研究发现经过人类反馈微调的 AI 助手会出现迎合倾向也就是阿谀奉承。资料不足时继续补全容易产生幻觉推理没有证据钉住会越写越远用户先给结论模型又容易顺着说。OpenAI 在 2025 年发过一篇研究题目就叫 Why Language Models Hallucinate。里面有个观点我很认同很多评测只奖励答对却没有奖励模型在不确定时放弃作答。这种评分方式其实是在逼模型猜。就像考试时不会也要蒙空着肯定没分写了还有机会撞对。想让 Agent 诚实就得让「我不确定先去查」也能得分。7 条规则直接放进soul.md一句古话还不够具体我把它补成了可执行的规则。## 认知诚实 知之为知之不知为不知是知也。 处理事实性或技术性问题时 1. 区分已验证事实、逻辑推断和待验证猜测。 2. 已验证事实要能指出证据或复现方式。 3. 逻辑推断要写明依据、前提和仍未确认的部分。 4. 不得编造来源、链接、文件、接口、版本号、日志和实验结果。 5. 用户的前提与证据冲突时直接指出不要为了迎合用户改变结论。 6. 缺少证据时优先检索、运行测试或请求用户补充信息。 7. 给关键结论加标记 - 有直接证据支持 - 基于现有证据的推断仍有条件限制 - 暂无足够证据需要继续查证或请用户确认。其中第 4 条最为关键。编一段分析可能只是浪费几分钟编一个不存在的版本号、论文标题或 API真的会把人带沟里。别太信那个 90%你问 Agent 有多大把握它张口就能给你一个90%。这个数字看着很科学实际上也可能是现编的。关于 LLM 自报置信度的研究发现模型经常过度自信换一种问法结果还可能跟着变。所以我更愿意看证据、多次回答的一致性和独立来源。按照这个思路我整理了一张评分表。评分维度我在检查什么权重证据支撑度Evidence外部资料能不能直接支撑答案40%多次回答一致性Consistency多次独立采样后结论是否稳定25%信源交叉验证Cross Validation独立来源能不能互相对上15%生成不确定性Uncertainty关键 token 和实体是否反复摇摆10%来源可靠性Source Quality来源是官方文档、论文、源码还是二手转述5%知识边界检测Boundary问题是否超出当前资料和工具的覆盖范围5%每项按0100分计算后乘以权重。生成越摇摆不确定性得分越低。85100分可以给明确结论6584分只给条件性判断 低于65分先查资料或找人确认。这里还得留个后门。关键事实没有直接证据或者几个可靠来源互相打架即使总分看着不低也不能标绿。加权分只能帮我们排风险不能把硬伤平均掉。这几个维度对应了业界常见的研究方向。Self-Consistency看多次回答是否收敛Uncertainty Estimation 看 token 概率和语义差异RAG Grounding Score 检查结论有没有检索资料支撑Calibration则用历史正确率校准置信度。单个指标都不保险放在一起更实用。还要几道保险一句话无法消灭所有幻觉。上下文会稀释规则检索资料可能过期模型甚至会编一份看起来很专业的证据分析。标题里的「根治」针对的是一个坏习惯没证据也要把答案补完整。真放到生产环境里Prompt 只能守第一道门。后面还要接官方文档和内部知识库关键结论绑定引用版本号、接口名、数字和链接交给程序校验高风险操作继续保留人工确认。还可以挑 20 个最容易翻车的问题做回归测试。每次调整soul.md后重新跑一遍看它会不会乱编该求助时能不能停下来。回到那句话真正的「知」也包括知道自己的边界。把这句话写进soul.md不会让 Agent 变得全知但能让它少装懂一点。如果你也在维护自己的soul.md、AGENTS.md或系统提示词可以先把上面的规则拿走再用手头那些最容易产生幻觉的问题试一遍。别只看它回答得像不像。看它凭什么这么回答。学习资源推荐如果你想更深入地学习大模型以下是一些非常有价值的学习资源这些资源将帮助你从不同角度学习大模型提升你的实践能力。一、全套AGI大模型学习路线AI大模型时代的学习之旅从基础到前沿掌握人工智能的核心技能​因篇幅有限仅展示部分资料需要点击文章最下方名片即可前往获取二、640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示​因篇幅有限仅展示部分资料需要点击文章最下方名片即可前往获取三、AI大模型经典PDF籍随着人工智能技术的飞速发展AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型如GPT-3、BERT、XLNet等以其强大的语言理解和生成能力正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。因篇幅有限仅展示部分资料需要点击文章最下方名片即可前往获取四、AI大模型商业化落地方案作为普通人入局大模型时代需要持续学习和实践不断提高自己的技能和认知水平同时也需要有责任感和伦理意识为人工智能的健康发展贡献力量。

相关新闻

2026/7/23 15:27:07

Codex 修改登录权限总出问题?先梳理认证链路再动代码

摘要登录成功却不断跳回登录页、刷新后权限丢失、普通用户看到管理员菜单,都是前端项目中常见的认证问题。这类故障通常同时涉及 Token、用户状态、路由守卫和接口权限。本文介绍如何让 Codex 先梳理完整认证链路,再进行最小范围修改和回归验证。很多开发…

2026/7/23 15:27:07

Claude Code环境配置与依赖冲突导致的信用额度报错排查指南

最近在尝试用 Claude Code 重构一个老项目时,遇到了一个让人头疼的问题:明明本地测试一切正常,但一提交到生产环境就提示“信用额度不足”。起初以为是 API 调用超限,但检查日志发现请求频率完全在合理范围内。这个问题困扰了我整…

2026/7/23 17:07:13

Python毕业设计-基于 Python 的大学生就业岗位智能推荐系统的设计与实现 高校学生职业测评与就业推荐服务平台(源码+LW+部署文档+全bao+远程调试+代码讲解等)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/23 17:07:13

2026GEO优化服务商怎么选?选对平台抢占AI问答流量

据中国信通院《生成式AI搜索产业白皮书(2026)》数据显示,2026年国内GEO广义市场规模突破 286 亿元,生成式AI问答流量占比正式超过传统搜索。越来越多企业意识到,想要抓住AI问答新流量,布局GEO已经势在必行。…

2026/7/23 17:07:13

Sub2API开源AI网关:多账号管理与配额分发实践

1. Sub2API项目概述 Sub2API是一款开源的AI API网关平台,旨在为开发者提供统一的中转服务,支持将Claude、OpenAI、Gemini、Grok等主流AI服务的订阅配额进行集中管理和分发。这个项目由Wei-Shaw团队开发并维护,目前在GitHub上获得了31.4k星标和…

2026/7/23 17:07:13

WSL环境下ROS 2开发环境搭建与优化指南

1. 项目概述在Windows系统上搭建ROS 2开发环境一直是个令人头疼的问题。传统方式要么需要双系统切换,要么虚拟机性能堪忧。直到Windows Subsystem for Linux(WSL)的出现,才让这个问题有了优雅的解决方案。今天我们就来详细拆解如何…

2026/7/23 17:02:13

嵌入式以太网开发:从PHY芯片到TCP/IP协议栈的完整方案解析

1. 项目概述与核心价值 在嵌入式系统开发中,实现稳定、高速的网络连接一直是个硬骨头。尤其是在工业控制、电信设备或者需要远程数据采集的场景里,你需要的不仅仅是一个能“联网”的功能,而是一个从物理层到协议栈都经过验证、能扛住恶劣环境…

2026/7/23 12:54:51

Unity与Python本地通信:基于Flask的跨语言数据交换实战

1. 项目概述:为什么我们需要一个本地通信服务器?在游戏开发、数字孪生、仿真训练等众多领域,Unity作为强大的实时3D内容创作平台,其核心逻辑通常由C#驱动。然而,当我们需要进行复杂的数据分析、机器学习推理、科学计算…

2026/7/23 0:01:10

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/22 21:00:12

3个高效策略:快速掌握Axure中文界面配置

3个高效策略:快速掌握Axure中文界面配置 【免费下载链接】axure-cn Chinese language file for Axure RP. Axure RP 简体中文语言包。支持 Axure 11、10、9。不定期更新。 项目地址: https://gitcode.com/gh_mirrors/ax/axure-cn 还在为Axure RP的英文界面感…