发布时间:2026/9/4 0:26:00
[论文分析]ZeroDayBench:面向网络防御的未知零日漏洞LLM智能体评估 ZeroDayBench: Evaluating LLM Agents on Unseen Zero-Day Vulnerabilities for Cyberdefense论文重点ZeroDayBench是首个专门评估LLM智能体在真实零日漏洞场景下自主发现与修复能力的基准测试集。该研究通过将已知CVE漏洞移植到功能相似但代码不同的开源项目中构建了22个前沿模型训练数据中不存在的高危漏洞任务CVSS ≥ 7.0测试了GPT-5.2、Claude Sonnet 4.5和Grok 4.1三款主流模型的零样本推理能力。研究发现即使在full-info完整信息条件下表现最佳的Claude Sonnet 4.5也仅达到95.7%的通过率而在真正的零日情境下无任何额外信息所有模型的成功率均仅为12%–14%——这揭示了一个核心结论前沿LLM尚不具备自主解决真实零日漏洞修复任务的能力。核心研究内容问题定义随着LLM被越来越多地部署为自主软件工程智能体其在代码库中自主发现和修复安全漏洞的能力备受关注。然而现有的网络安全评估基准存在两个根本性问题一是依赖模糊测试发现的漏洞或历史CVE这些数据很可能已存在于模型训练集中导致评估结果反映的是记忆检索能力而非真正的推理能力二是现有基准多聚焦于低影响漏洞无法反映高风险安全场景的真实需求。ZeroDayBench旨在解决这两个核心缺陷提供一种能够衡量模型零样本推理能力而非记忆能力的评估框架。创新方法1漏洞移植Vulnerability Porting这是ZeroDayBench最核心的技术创新。研究团队并非直接使用已知CVE的原始漏洞代码而是将真实CVE的根因移植到功能相似但代码完全不同的目标仓库中。例如Redis CVE-2023-41056是一个在SDS字符串缓冲区调整大小中导致堆溢出和RCE的整数溢出漏洞团队将其移植到MinIO的wholeBitrotReader.ReadAt()函数中——该函数执行类似的S3对象范围读取缓冲区操作使根因具备了可移植性。这种方法确保了漏洞在训练数据中不存在极大降低了模型通过记忆来作弊的可能性。2五级信息可见度设计研究设计了五个难度级别来模拟漏洞生命周期的不同阶段zero-day仅告知找到并修补一个高危漏洞无任何额外信息cwe给出CWE通用类别如内存破坏漏洞post-exploit提供攻击者成功利用后的影响描述但不指明根因one-day告知具体哪个文件的哪个函数存在漏洞及问题性质full-info提供精确的修复位置和具体操作说明这种设计能够精细测量智能体在不同信息量下的表现揭示模型在真实漏洞响应流程中各阶段的能力边界。3基于渗透测试的评估方法与传统基准仅检查补丁是否生成不同ZeroDayBench引入了自定义的渗透测试评估方法通过验证修复后实时漏洞利用是否被阻止来评判补丁有效性。研究成果定量结果在三款模型的测试中Claude Sonnet 4.5以56.0%的总体通过率位居第一GPT-5.2以48.2%紧随其后Grok 4.1 Fast为34.0%。在zero-day难度下三款模型表现相当12.8%、14.4%、12.1%但随着信息量增加Claude Sonnet 4.5展现出更明显的优势——在full-info条件下达到95.7%的通过率远超GPT-5.2的76.2%和Grok的58.8%。行为分析研究发现了一个清晰的趋势——信息越充分模型成功率越高这符合直觉但同时也说明当前模型在自主漏洞发现真正的零日场景方面能力严重不足。实际落地应用的可能性高可行性方向辅助安全审计在one-day及以上信息级别75%–95%成功率模型已能作为安全工程师的辅助工具在已知漏洞位置和类型的情况下生成有效补丁安全培训与演练ZeroDayBench可作为红队演练的训练平台帮助安全团队测试和提升LLM辅助漏洞修复的能力低可行性方向完全自主的零日漏洞发现与修复在zero-day级别12%–14%的成功率远不能满足生产环境的安全要求取代专业安全研究人员当前模型在缺乏明确指引时表现欠佳无法替代人类专家的判断技术细节漏洞注入技术漏洞注入通过针对性的代码修改实现主要包括将安全库调用替换为不安全的等价调用移除认证检查或输入 sanitization例如移除MLFlow的quote()参数 sanitization 函数以启用 shell 注入CVE-2020-11978将GitPython切换为原始subprocess.run(shellTrue)调用CVE-2021-21300变体设计研究构建了两种类型的任务变体跨仓库变体Cross-repo variation将同一个CVE移植到多个目标中。例如CVE-2021-23017nginx DNS解析器中的off-by-one漏洞被移植到HAProxy、Squid和Tinyproxy三个C语言仓库——它们各自以不同方式实现DNS解析。仓库内变体Intra-repo variation在单个目标中实现同一根因的多种变体。Squid有7个CVE-2021-23017变体通过不同方法引入内存破坏移除长度检查、整数下溢、空字节投毒、双重释放等Mosquitto有3个CVE-2024-42655变体使用不同的ACL绕过方法。智能体架构智能体采用简单的循环架构基础LLM配备两个工具# 伪代码示意classZeroDayAgent:tools[BashTool(# 执行任意bash命令timeout120,# 超过120秒则取消max_output10000# 超过10000字符则截断),EditTool()# 添加和编辑指定文件中的文本]max_turns100# 最大工具调用轮次terminationno tool callsormax turns reached漏洞复盖范围基准涵盖的漏洞类型包括RCE远程代码执行反序列化、命令注入、SSTI权限提升与认证绕过SQL注入内存破坏缓冲区溢出、off-by-one路径遍历涉及的开源项目包括MLFlow、Flyte、Mosquitto、vLLM、Dropbear、HAProxy、Squid、Tinyproxy、Jenkins、Minio、Verdaccio等。研究设定实验配置配置项详情评估时间2026年1月15日至2月1日测试模型GPT-5.2推理设为Medium、Claude Sonnet 4.5、Grok 4.1 Fast启用推理最大工具调用轮次100轮Bash命令超时120秒输出截断阈值10,000字符运行环境Docker容器化环境漏洞来源与筛选漏洞选自NVD和cvedetails.com公共数据库筛选标准包括CVSS评分 ≥ 7.0高危或严重主要攻击向量包括RCE、权限提升、认证绕过、命令注入包含拒绝服务和内存破坏漏洞排除链式漏洞chained vulnerabilities硬件/软件要求核心依赖Docker容器化隔离环境API访问需要GPT-5.2、Claude Sonnet 4.5、Grok 4.1 Fast的API权限计算资源论文未明确说明具体硬件配置但考虑到涉及代码库编译、测试执行和LLM API调用建议具备至少16GB内存和多核CPU的中高端开发机器综合分析研究团队背景与可信度第一作者Nancy Lau是UC Santa Cruz计算机科学与工程系的博士生研究兴趣聚焦于AI智能体的安全性此前有固件安全和CTF竞赛背景。她曾创立本科网络安全俱乐部并在SPAR项目下主导了AI漏洞检测基准的创建。其博士提案聚焦于通过强化学习实现安全编码智能体。共同作者Louis Sloot来自卡内基梅隆大学。HUD AI的Dylan Bowman等作者来自产业界。论文已被ICLR 2026的Agents in the Wild Workshop接收。从团队构成来看该研究兼具学术严谨性UCSC、CMU等顶尖机构和产业相关性HUD AI的参与并非纯理论推演。第一作者在AI安全领域的持续深耕从固件安全到CTF再到AI智能体安全为研究提供了扎实的技术功底。技术真实性评估漏洞移植方法的可行性该方法在技术上是真实且可行的。漏洞的根因root cause往往具有跨代码库的可移植性——例如缓冲区边界检查缺失、输入验证不足等逻辑缺陷可以在不同实现中出现。研究团队选择功能相似的代码位置进行移植如Redis的SDS缓冲区和MinIO的S3范围读取这符合软件安全研究的常规实践。但需要指出的是严格保证这些补丁从未出现在训练数据中是无法做到的——研究团队自己也承认这一点将其定位为降低直接记忆信号的汙染控制方法而非绝对保证。评估方法的有效性基于渗透测试的补丁验证方法比单纯检查补丁是否生成更为严格。这种方法能够有效避免生成看似合理但实际无效的补丁这类假阳性在技术上是扎实的。模型选择的合理性GPT-5.2、Claude Sonnet 4.5和Grok 4.1 Fast是2026年初的前沿模型在先前软件工程基准上表现优异选择这三款具有代表性。核心洞见1零日漏洞修复能力的真实瓶颈12%–14%的zero-day成功率是一个警示性数据。它说明当前最先进的LLM在面对真正未知的漏洞时自主发现能力极为有限。这不是记忆与推理的争论而是根本性的推理能力缺失——模型可以在被告知问题位置后有效修复full-info达95.7%但无法自主定位问题。2信息级别的阶梯效应从zero-day12%到full-info95.7%Claude Sonnet 4.5的性能提升近乎线性。这说明漏洞修复的不同阶段对AI能力的要求截然不同定位漏洞需要深度代码理解和推理远比修复漏洞需要代码生成能力困难。这一发现对安全工具的设计具有重要指导意义——与其追求全自动漏洞修复不如先开发辅助定位自动修复的人机协作模式。3对AI取代安全工程师论调的审慎回应论文结果明确表明至少在零日漏洞防御领域AI远未达到取代人类专家的水平。但这也意味着AI可以作为强大的辅助工具——在人类指明方向后高效完成修复工作。局限性漏洞移植的人工成本高每个漏洞需要人工分析根因、寻找可移植的目标代码位置并进行修改难以大规模扩展评估模型的API依赖测试依赖特定商业模型的API结果可能随模型版本更新而变化仅复盖开源代码库对闭源商业软件的可迁移性有待验证排除链式漏洞现实中的零日漏洞往往是链式的简化了评估场景实践应用对安全工程师的建议1. 将LLM定位为高级修复助手而非自主安全分析师在zero-day和cwe级别12%–33%成功率让LLM自主发现和修复漏洞风险极高。建议的工作流是人类定位漏洞 → LLM生成修复方案 → 人类审查验证。在one-day及以上级别75%–95%成功率LLM可作为高效的补丁生成工具。2. 利用五级信息框架设计人机协作流程ZeroDayBench的信息级别设计本身就映射了真实漏洞响应流程漏洞发现阶段对应zero-day/cwe依赖人类专家的代码审计能力影响评估阶段对应post-exploit人类分析攻击面AI可辅助影响范围评估修复实施阶段对应one-day/full-infoAI高效生成补丁人类审查3. 警惕训练数据汙染问题ZeroDayBench的漏洞移植方法提醒我们使用历史CVE数据训练或评估的AI安全工具可能存在严重的过拟合风险。在采购或部署AI安全产品时应要求供应商提供在未见漏洞上的评估数据。对研究者的建议1. 扩展漏洞移植的自动化程度当前人工移植成本高、规模小仅22个任务。未来研究可探索自动化漏洞模式提取与移植方法以构建更大规模的零日评估基准。2. 研究定位能力与修复能力的解耦论文暗示模型的定位能力远弱于修复能力。这是一个值得深入研究的切入点——是否可以单独训练或微调模型的漏洞定位能力是否可以开发专门的漏洞定位智能体与漏洞修复智能体协作3. 探索强化学习在安全智能体中的应用第一作者Nancy Lau的博士研究恰好聚焦于此——通过RL实现安全编码智能体。ZeroDayBench可作为这类研究的评估平台测试RL增强的智能体是否能在zero-day场景中超越纯LLM方法。参考资料来源原始论文: https://arxiv.org/pdf/2603.02297ICLR 2026 Workshop “Agents in the Wild”: https://iclr.cc/ Workshop信息作者信息: UC Santa Cruz (Nancy Lau), Carnegie Mellon University (Louis Sloot), HUD AI (Dylan Bowman, Mario Brajkovski, Jaideep Chawla), New York University (Dan Zhao)

相关新闻

2026/9/4 0:25:59

企业通信NAT穿透与会话保活全解:400电话、云客服、呼叫中心、AI机器人、私有化部署单通断线根治规范

摘要:单通、间歇性无声、通话几分钟自动断线、转接后丢媒体、外网坐席通话不稳定,是企业通信最顽固、最难复现的高频问题。绝大多数此类故障并非设备、线路、信令BUG,而是NAT端口老化、媒体端口映射失效、会话保活机制不匹配、公私网链路隔离…

2026/9/4 1:11:04

解析split与mph:用Python构建运动速度曲线分析模型

先跑一段速度数据,看看自己到底能榨出多少信息。最近我在处理运动表现数据时,拿到一组类似「2.88 split / 31.21 mph」的记录,一开始只觉得是一个分段计时和瞬时速度,真正动手做转换、建模、可视化之后,才发现里面的门…

2026/9/4 1:11:04

Qt常用控件学习路线:理解对象树与信号槽,手写界面代码

重学 Qt 的第二站,几乎都会落在常用控件上。Qt 自带的控件种类远不止 QPushButton、QLabel 这几样,但如果只是逐个控件试属性,学完两周后很容易发现自己只是记住了 API 名,遇到一个带输入框、下拉框和表格的窗口仍然不知道代码该怎…

2026/9/4 1:11:04

Matlab仿真椭圆振动铣削:从轨迹规划到超声加工应用

简介:本资源面向机械制造、超声加工及先进切削工艺领域的研究生、工程师与科研人员,聚焦椭圆振动铣削这一融合超声技术与传统铣削的高精度加工方法,解决难加工材料切削力大、表面质量差、刀具磨损快等工程痛点。压缩包共2个文件(1…

2026/9/4 1:11:04

MATLAB森林火灾检测实战:构建抗干扰鲁棒工作流

简介:本资源是一套基于图像处理技术的森林火灾检测Matlab实现方案,面向计算机、电子信息工程、数学等专业的本科生,适用于课程设计、期末大作业及毕业设计等实践教学场景,解决真实环境下的火焰与烟雾识别问题。压缩包共18个文件&a…

2026/9/4 1:06:03

AI电话外呼工具有哪些?AI初筛+真人坐席如何守住B24合规

【数据截止日期:2026年9月3日】【作者资质说明:本文作者为通信行业独立观察者,拥有5年以上企业通信服务研究经验(作者自陈述,未附第三方资质证明),本文为第三方自媒体平台发布的行业科普内容&am…

2026/9/3 18:28:26

vSound小提琴数字处理器实操指南:从接线到演出的完整配置

电小提琴或者原声小提琴插电演出,第一个绕不开的坎就是声音难听。原声琴的共鸣和空气感一旦进了拾音器,出来的往往是一坨干瘪、发尖、带着奇怪塑料味的信号。我当初第一次把琴接上乐队调音台,直接被主唱吐槽"你这声音像在锯钢丝"。…

2026/9/3 14:29:47

传感器接口IC如何攻克生物化学传感的微弱信号难题?

1. 从电极到比特流:为什么生物化学传感必须依赖专用接口IC 做生物化学传感的人都有过类似的经历:明明传感器本身性能很好,信号输出却一塌糊涂——噪声大、漂移明显、重复性差,怎么调都达不到预期。很多时候问题并不在传感器&#…

2026/9/3 14:30:35

STM32F411CEU6多通道ADC采集:扫描模式+DMA实现详解

1. 多通道 ADC 的用武之地把“Multichannel ADC”和“STM32F411CEU6”这两个关键字放在一起,其实就是嵌入式开发里最常遇到的一类需求:用一块不算贵的 MCU,同时采集多路模拟信号。STM32F411CEU6 是 48 引脚的 Cortex-M4F 主控,主频…

2026/9/4 0:00:58

STM32H743 SPI从机DMA双缓冲通信实战

简介:本资源是面向嵌入式开发工程师与STM32进阶学习者的SPI DMA双机通信从机端完整实现方案,聚焦STM32H743高性能Cortex-M7单片机在工业控制与高速数据交互场景下的从机通信开发痛点。压缩包含1355个文件,主体为599个C源码与321个头文件&…

2026/9/4 0:00:58

CPU开盖降温教程:20元成本让温度直降30度的原理与实践

最近很多朋友都在抱怨,自己的电脑一到夏天就变成"烤箱",玩游戏时CPU温度动不动就飙到90度以上,风扇噪音堪比直升机。更让人头疼的是,明明配置不错,却因为高温降频导致性能大打折扣。如果你也遇到了类似问题&…

2026/9/4 0:00:58

ArkTS 表单工程:场地预约页的三态场次 Grid 与校验

ArkTS 表单工程:场地预约页的三态场次 Grid 与校验 App 14「运动场地预约」场地 Tab(Func1Tab),是整 App 交互最丰富的页面——场地横向切换 三色图例 渐变预约预览卡 快捷模板 今日场次 Grid(可选/已选/已满三态&…

2026/9/3 20:43:36

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/3 17:51:43

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/3 21:06:57

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…