发布时间:2026/8/14 15:02:44
[论文学习]MINJA:针对LLM智能体的实用内存注入攻击 MINJA: A Practical Memory Injection Attack against LLM Agents (2025)论文重点MINJAMemory INjection Attack提出了一种无需直接篡改智能体内存库即可实施内存投毒攻击的方法。攻击者仅通过普通用户的查询交互就能诱导LLM智能体自主生成并存储恶意记录从而在后续受害者查询时误导智能体的推理过程。论文在医疗、电商和通用问答等多个场景下验证了该攻击的有效性揭示了当前LLM智能体内存管理机制中存在的严重安全漏洞。核心研究内容问题定义LLM智能体与普通LLM的一大区别在于其配备的长期记忆库——系统会将过往的查询与推理轨迹存储下来当新查询到来时检索最相关的历史记录作为上下文示例in-context demonstration辅助智能体完成当前任务。然而这个设计引入了一个严重的安全隐患如果内存库被污染检索到的恶意示例会误导智能体的推理。论文举了一个令人不安的例子——自动驾驶智能体的内存若被注入“在极高时速下执行急停”的记录用户可能在高速公路上遭遇突然刹停引发致命事故。已有研究如AgentPoison虽然探索过这一威胁但它们都假设攻击者拥有直接修改内存库的特权。现实世界中这种系统级权限几乎不可能获取。MINJA的核心问题在于在攻击者只是一个普通用户、只能通过查询与智能体交互的条件下能否实现内存投毒创新方法MINJA的技术设计围绕两个核心挑战展开挑战一恶意记录该如何设计才能有效误导智能体攻击者的目标是对受害者查询 ( q_v )包含受害者实体 ( v )让智能体生成目标查询 ( q_t ) 对应的推理步骤 ( R_{q_t} )( q_t ) 将 ( v ) 替换为目标实体 ( t )。问题在于( q_v ) 和 ( R_{q_t} ) 之间存在逻辑鸿沟——一个关于“患者A”的查询推理步骤怎么会变成“患者B”的数据MINJA的解决方案是引入桥接步骤Bridging Steps。例如在医疗场景中桥接步骤可以是“患者A的数据现在保存在患者B的名下”——这个看似合理的中间推理将受害查询与目标推理逻辑连接起来。桥接步骤需要足够通用因为受害者可能提出任意包含 ( v ) 的查询。同时恶意记录的查询语句必须保持“良性”外观避免使用罕见或异常内容以确保后续能被正常检索。挑战二如何诱导智能体自主生成并存储这些恶意记录由于无法直接写入内存攻击者必须让智能体“自己动手”。MINJA设计了一个指示提示Indication Prompt——一段附加在攻击查询后的逻辑推理步骤序列用于诱导智能体生成桥接步骤。但问题又来了如果查询中始终带着这个“指示提示”那么存储的记录与正常受害者查询的相似度可能不够高影响检索概率。为此MINJA提出了渐进缩短策略Progressive Shortening Strategy, PSS——逐步从查询中移除指示提示的内容同时确保智能体的响应中仍保留桥接步骤和目标推理。经过多轮迭代最终存入内存的记录 ((a_v, [b_{v,t}, R_{a_t}])) 在外观上已与正常查询无异。整个攻击流程可以概括为攻击者提交带有指示提示的查询 → 智能体生成含桥接步骤的响应并存入内存 → 攻击者逐步缩短提示 → 最终存入“干净”的恶意记录 → 受害者提交查询时该记录被检索为示例 → 智能体被误导生成目标推理。研究成果论文在三种不同类型的智能体上进行了广泛实验智能体场景数据集基座模型EHRAgent医疗电子健康记录MIMIC-III、eICUGPT-4RAP电商网页购物WebshopGPT-4、GPT-4oQA Agent通用问答MMLUGPT-4、GPT-4o评估采用三个指标注入成功率ISR恶意记录成功存入内存的比例攻击成功率ASR存入的恶意记录成功误导智能体的比例效用下降UD攻击对智能体正常任务性能的影响核心实验结果ISR普遍超过90%EHRAgent在MIMIC-III上达95.6%eICU上达98.5%RAPGPT-4o达99.3%QA Agent达100%ASR表现突出EHRAgent在eICU上达90.0%RAPGPT-4o达98.5%不同场景下ASR在57%至98.5%之间UD极小几乎所有场景下UD在±10%以内表明攻击对智能体正常功能几乎没有副作用值得注意的是MINJA在被NeurIPS 2025接收为Poster论文侧面印证了该工作的学术价值。实际落地应用的可能性MINJA的攻击条件极为宽松——攻击者只需像普通用户一样与智能体交互无需任何系统特权。这意味着任何能够访问公共智能体服务的用户都可能成为攻击者共享内存库的设计在现有智能体框架中非常普遍ChatGPT的“为所有人改进模型”功能即为一例即便系统采用隔离内存账户劫持等身份伪装手段也比获取系统级权限现实得多从防御角度看MINJA揭示的漏洞具有迫切的现实意义。随着LLM智能体在医疗、金融、自动驾驶等高 stakes 领域加速落地这类攻击的实际危害不容忽视。技术细节攻击的形式化定义设受害者查询为 ( q_v )其中包含受害者实体 ( v )。攻击者的目标是让智能体对 ( q_v ) 生成目标推理 ( R_{q_t} )其中 ( q_t ) 是将 ( v ) 替换为目标实体 ( t ) 后的查询。恶意记录的理想形式为[(a_v, [\mathbf{b}{v,t}, \mathbf{R}{a_t}])]其中( a_v )包含受害者实体 ( v ) 的攻击查询外观上与正常查询无异( \mathbf{b}_{v,t} )桥接步骤逻辑上连接 ( v ) 和 ( t )( \mathbf{R}_{a_t} )目标查询 ( a_t ) 对应的推理步骤渐进缩短策略PSS设指示提示为 ( [r_1, r_2, \ldots, r_n] )每一步缩短操作为[[a_v, r_1, r_2, \ldots, r_{n-i}] \rightarrow [a_v, r_1, r_2, \ldots, r_{n-i-1}]]即每次从末尾移除一个推理步骤 ( r_{n-i} )。经过 ( n ) 轮迭代后最终存入的记录为 ( (a_v, [b_{v,t}, R_{a_t}]) )。检索机制智能体基于查询相似度从内存中检索 ( k ) 条最相似的记录作为上下文示例。MINJA正是利用这一机制通过让恶意记录的查询 ( a_v ) 与受害者查询 ( q_v ) 高度相似确保恶意记录被检索到。论文采用余弦相似度计算文本嵌入相似性。研究设定硬件与软件配置论文未明确列出具体的硬件配置但从实验描述可以推断模型GPT-4和GPT-4o通过API调用嵌入模型all-MiniLM-L6-v2用于EHRAgent和RAP、text-embedding-ada-002用于QA Agent内存检索数量RAP检索3条、EHRAgent检索4条、QA Agent检索5条实验设计细节受害-目标配对每个配置进行9组独立实验医疗场景Patient ID配对、Medication配对电商场景商品配对QA场景术语配对将答案按字母表偏移4位攻击查询数量MMLU用10条其他数据集用15条指示提示缩短次数Patient ID缩短4次、Medication/Items/Terms缩短5次内存初始化EHRAgent预置4条良性记录RAP和MMLU从空内存开始综合分析MINJA这篇论文的贡献远不止于“发现了一个漏洞”——它在几个层面上推动了LLM智能体安全研究的前沿。首先是威胁模型的突破。以往的智能体内存攻击研究如AgentPoison假设攻击者拥有直接修改内存的能力。这个假设在现实世界中几乎不成立——谁能直接修改ChatGPT的内存库MINJA将攻击者降维到“普通用户”级别揭示了即使没有任何特权内存投毒依然是可行的。这才是真正让人不安的地方。其次是技术设计的精巧。桥接步骤 指示提示 渐进缩短三个组件环环相扣。桥接步骤解决的是“逻辑鸿沟”——为什么查询A会导致推理B指示提示解决的是“如何让智能体自己生成”——不能直接写就诱导它自己写。渐进缩短解决的是“如何不留痕迹”——最终存入的记录在外观上与正常记录无异。这套组合拳打下来攻击的隐蔽性和实用性都得到了保证。再者是实验的覆盖面。论文没有停留在单一场景而是覆盖了医疗EHRAgent、电商RAP、通用问答QA Agent三个截然不同的领域。这种跨领域的验证说明了漏洞的普遍性——不是某个特定框架的设计缺陷而是当前LLM智能体“共享内存 相似度检索 上下文学习”这套通用架构的系统性风险。一个值得注意的细节是ASR的波动。在MMLU上QA Agent的ASR从40%到100%不等标准差高达19.1%。这说明攻击效果受具体受害-目标配对的影响很大——有些配对容易误导有些则不然。这种不稳定性既是攻击者的挑战也暗示了潜在防御的可能方向也许可以通过分析哪些类型的实体替换更容易被“桥接”来设计针对性的防护。从更宏观的视角看MINJA揭示的问题本质上是“信任链的断裂”。智能体信任内存中的历史记录是可靠的但MINJA证明了这个信任可以被轻易利用。这让人联想到传统软件安全中的“信任输入”问题——永远不要信任用户输入。而对于LLM智能体来说或许我们应该加上一条新原则永远不要无条件信任内存中的历史记录。实践应用对智能体开发者的建议内存隔离最直接的防御是避免不同用户共享同一内存库。如果必须共享至少要对写入内容进行严格审核。检索过滤在将内存记录作为上下文示例之前增加一道安全检查——检测是否存在异常的“桥接”逻辑如将实体A映射到实体B。谨慎存储推理链论文指出不应将完整的链式推理CoT存储为内存记录。推理链越详细被操纵的空间就越大。写时策略Write-time Policy对即将写入内存的内容进行异常检测识别可能包含桥接步骤或异常实体映射的记录。对普通用户的建议对于使用公共智能体服务如ChatGPT、医疗咨询AI等的场景应意识到你看到的结果可能受到其他用户交互的影响在涉及敏感决策医疗、金融、安全的场景中对智能体的输出保持审慎态度必要时进行人工复核研究人员的后续方向防御机制设计如何有效检测和抵御MINJA这类攻击目前论文仅验证了攻击的有效性防御仍是开放问题攻击的进一步演化MINJA针对的是实体替换场景更复杂的攻击如情感操纵、立场转换是否也可行内存安全的理论框架能否建立一套形式化的内存安全模型指导智能体系统的安全设计参考资料原始论文Dong, S., Xu, S., He, P., Li, Y., Tang, J., Liu, T., Liu, H., Xiang, Z. (2025).Memory Injection Attacks on LLM Agents via Query-Only Interaction. arXiv:2503.03704. https://arxiv.org/abs/2503.03704NeurIPS 2025 Poster https://neurips.cc/virtual/2025/loc/san-diego/poster/118152

相关新闻

2026/8/14 15:02:44

dynamic java 别被忽悠了!Apache的动态Java?那纯属张冠李戴

用C编写的HTTP, 其(静态)以及/event(动态)MPM属于自身进程/线程调度策略, 和Java没有关系, Java应用借助等容器来运行, 仅仅充当反向代理。HTTP自身是由C编写而成的, 并非直接运用Java, 所谓Java中的与进程管理模式存在着概念上的…

2026/8/14 15:02:44

10个AI提示词,让你的Java代码从“能用”到“能打”

大家好,我是你们的AI编程道友-逆熵而行。你是否也遇到过这样的场景:别怕!今儿分享10个着实超实用之AI提示词, 让其变为你的“专属Java代码优化师”。新手可以抄, 老手亦能爽, 代码由“能跑”径直进化至“能打”!3 个 “提速” 提示…

2026/8/14 15:42:48

第5章 多帧对齐与融合:全局对齐、局部对齐与融合策略

作者:一位在ISP领域摸爬滚打十余年的算法工程师 “纸上得来终觉浅,绝知此事要躬行。”——这门课的每一行代码,都希望你亲自跑一遍。 从原理到代码,从理论到工程落地 本课程共30章,系统讲解ISP核心算法——多帧降噪、HDR合成、夜景算法的原理、实现与调优。 每章包含:原理…

2026/8/14 15:42:48

AI edusrc挖掘技巧信息收集篇

信息收集篇: 选择自己想挖掘的edu大学站进入fofa 先拿到它的一个ip host“fafu.edu.cn”在ip138里面搜索 这个ip210.34.80.210知道子网掩码 210.34.80.0/20 然后在新的界面点击旁站查询可以挑选信息多的 也可以看少的 也可以全部都看找功能点多的 静态网页 纯浪费时…

2026/8/14 15:42:48

基于linux上的终端贪吃蛇

摘要:不依赖图形库,用 C 语言在 Linux 终端实现贪吃蛇。本文从墙体绘制、蛇节点打印与移动、非阻塞键盘输入、食物随机生成到碰撞检测,逐步拆解核心逻辑,并附上关键代码与常见问题解决方案。前言:本文面向具备 C 语言基…

2026/8/14 4:27:24

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/14 4:27:24

当 LLM 遇见大文档:主流开源项目如何处理上下文超限

从 Agentic Loop 到 Repo Map,七种策略与六类陷阱引言:128K vs 10MB 的硬冲突 2026 年的 LLM 上下文窗口已达到 128K ~ 1M token(≈ 0.5MB ~ 4MB 文本),但 LLM 想要处理的真实数据规模远远超过这个量级:真实…

2026/8/14 0:00:09

Flutter与OpenHarmony实现剧本杀组队表单开发实战

1. 项目概述在移动应用开发领域,跨平台框架Flutter因其高效的开发体验和出色的性能表现,已经成为众多开发者的首选。而OpenHarmony作为新兴的操作系统平台,其开放性和灵活性为开发者提供了全新的可能性。本文将聚焦于一个实际应用场景——剧本…

2026/8/14 0:00:09

VSCode高效Git管理:从入门到实战技巧

1. 为什么选择VSCode进行Git代码管理作为微软推出的轻量级代码编辑器,Visual Studio Code(简称VSCode)已经成为全球开发者使用率最高的编辑器之一。根据2023年Stack Overflow开发者调查,VSCode的市场占有率高达74.48%。它内置的Gi…

2026/8/14 4:27:24

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/14 4:27:24

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/14 4:27:24

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…