近期爆火!Strix自动挖掘漏洞,配合GPT最新模型速度和质量双爆炸

发布时间:2026/9/23 0:23:53

近期爆火!Strix自动挖掘漏洞,配合GPT最新模型速度和质量双爆炸 Strix让 AI 替你做渗透测试的开源神器—— 43,000 Star96% 基准测试通过率AI 驱动的自动化白帽审计━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━一、为什么我们需要关注 Strix在传统的应用安全测试中我们面临一个两难选择• 静态扫描器SAST速度快但误报率高达 20% 以上安全工程师要花大量时间做漏洞确认• 手动渗透测试准确率高但周期动辄数周成本也高得吓人• 动态扫描器DAST介于两者之间但覆盖面有限尤其对业务逻辑漏洞无能为力。Strix 的出现试图用 AI Agent 打破这个困局——它不是简单地用大模型跑 nmap而是把渗透测试的纪律性编码进了 Agent 的系统提示和工具契约里先侦察再测、必须 PoC 验证、漏报不算数、只有专门 Agent 才能报漏洞。核心卖点每一个发现的漏洞都附带可复现的概念验证PoC只有验证成功的漏洞才会输出大幅降低无效告警。二、Strix 是什么Strix 是一款开源的 AI 自动化渗透测试工具采用 Apache 2.0 协议目前在 GitHub 上已获得超过 43,000 颗 Star。给定目标代码目录、GitHub 仓库或线上地址它会启动一组 AI Agent像真人黑客一样去跑程序、找漏洞、写 PoC 验证最后输出可直接用于整改的测试报告。项目基本信息项目详情GitHub 仓库github.com/usestrix/strix开源协议Apache 2.0PyPI 包名strix-agentGitHub Stars43,000提交数量674 次最新版本v0.6.0持续更新中初始开源日期2025年8月9日在线平台app.strix.ai文档地址docs.strix.ai三、核心架构多智能体协同作战Strix 采用 Graph of Agents代理图多代理编排架构侦察、利用、后渗透阶段由专属 AI Agent 分工协作支持多目标并行扫描、漏洞链式串联利用还原真实红队作业模式。3.1 Agent 工具箱Strix Agent 在 Docker 沙箱中能调用的工具集和真人 Pentester 用的是同一套工具模块能力说明HTTP 拦截代理深度集成 Caido全量请求/响应拦截与分析适合复现和篡改交互浏览器自动化Playwright 驱动多标签页环境测 XSS/CSRF/点击劫持/认证绕过等前端场景终端环境交互式 Shell沙箱内执行 Kali 工具模拟攻击链Python 运行时写自定义 Exploit 并当场跑快速做概念验证PoC侦察模块自动化 OSINT 攻击面测绘、子域名枚举、指纹识别代码分析SAST DAST 结合semgrep 等工具做白盒分析主动探测做黑盒分析漏洞知识库结构化 findings带 CVSS 评分和 OWASP 分类3.2 漏洞覆盖面Strix 的 skills/vulnerabilities/ 目录下有 23 个漏洞类型的知识包覆盖 OWASP Top 10 及以外漏洞类别代表漏洞注入攻击SQL 注入、NoSQL 注入、SSTI、OS 命令注入、HTTP 请求走私服务端漏洞SSRF、XXE、不安全反序列化、RCE、路径穿越/LFI/RFI客户端攻击XSS存储型/反射型/DOM 型、CSRF、原型链污染、开放重定向访问控制IDOR、功能级授权绕过BFLA、大规模赋值业务逻辑竞态条件、支付操纵、工作流绕过认证与会话JWT 攻击、会话固定、子域接管、信息泄露API 安全认证失效、批量赋值、速率限制绕过基础设施配置错误、云元数据暴露、服务暴露四、实际测试成绩重点以下测试数据均来自公开的独立测评和基准测试非官方营销数据。4.1 XBEN 基准测试96% 通过率XBEN 是一个包含 104 个真实世界 Web 安全挑战的 CTF 格式基准测试平台。在独立测评中Strix 的表现如下指标成绩总挑战数104 个成功解决100 个通过率96%平均每题耗时约 19 分钟总测试成本$337单题平均成本约 $3.37误报率趋近于零PoC 验证机制关键对比在同场测试中独立安全研究机构 Escape 的测评指出Strix 和另一个 Agent 能够交付可操作的结果确认关键漏洞并生成 PoC 利用代码而多个竞品PentAGI、PentestGPT 等遭遇了设置或执行失败根本无法完成测试。4.2 18 个大模型横评谁最适合做渗透测试安全研究员 TheArtificialQ 花了近 100 小时使用 Strix v0.8.3 对 18 个不同的 LLM 模型进行了黑盒渗透测试横评。测试目标是一台包含 14 个漏洞的靶机服务器CVSS 评分从 4.8 到 9.9满分 105.2 分每个模型测试 3 次取平均分。测试结果排名按平均分从高到低排名LLM 模型平均分备注1GLM 5.1智谱61.1冠军长程代理任务表现最佳分数范围 53.9-70.52GPT-5.4OpenAI~45-50亚军但倾向于过早收手3Sonnet 4.6Anthropic40.8分数尚可但单次测试成本高达 $55.94step-3.5-flash~35-38小模型梯队第一曾免费可用5kimi-k2.5月之暗面~35-37小模型梯队第二性价比高6gemma-4-31b-it~25-28最小模型表现尚可7deepseek-v3.2~25-28令人失望与 gemma-4 持平但贵 2 倍8grok-4.200 分完全无效拒绝执行渗透测试9nemotron-3-super0 分NVIDIA 模型未得分关键发现① 认真做渗透测试必须用大模型大且贵的模型。便宜模型集中在同一 mediocre 区间而真正拉开差距的模型都明显更贵。② Anthropic 模型的缺席之谜Sonnet 4.6 通过 Claude APITier 1测试时2 小时内触发 105 次 超过 30,000 输入令牌/分钟速率限制 错误仅发现 1 个漏洞就烧掉了 $20。通过 OpenRouter 绕过限制后单次测试成本高达 $55.9约为 GPT-5.4 的 3 倍。③ GLM 5.1 的意外夺冠这款发布仅一周的模型在长程代理任务中表现最佳其设计定位long-horizon agentic work与渗透测试的多步骤推理需求高度契合。4.3 Duck Store 多工具对比测试01webmasters 对 5 款 AI 渗透测试工具进行了灰盒条件下的基准对比测试。测试目标为 Duck Store——一个故意设计为存在 20 个已知漏洞的 Web 应用React 前端 FastAPI 后端覆盖注入、SSRF、XSS、IDOR、业务逻辑、访问控制、认证缺陷、信息泄露、开放重定向等类别。工具底层模型发现漏洞检测率运行时长误报率Escape专有模型15/2075.0%4 小时6.25%ClaudeOpus 4.614/2070.0%10 分钟6.67%PentAGIDeepSeek v3.29/2045.0%4 小时10.00%ShannonDeepSeek v3.26/2030.0%6 小时25.00%StrixDeepSeek v3.21/205.0%2 小时0.00%重要分析• Strix 在此测试中仅检测到 1 个漏洞产品过滤器中的未认证 SQL 注入检测率最低。但值得注意的是其误报率为 0%——虽然样本量太小但印证了 PoC 验证机制的有效性。• 使用相同模型DeepSeek v3.2的三个工具表现差异巨大PentAGI 45% Shannon 30% Strix 5%。这表明工具的编排层orchestration layer——代理动作循环结构、工具调用管理和认证处理——是决定性能的关键变量模型选择反而是次要考虑。注意该测试仅运行一次未取多次平均值。Strix 使用的是 DeepSeek v3.2 这一较弱的模型而非推荐的 GPT-5.4 或 GLM 5.1。结合 18 模型横评数据Strix 配合顶级模型时表现显著提升。4.4 OWASP Juice Shop 实战对比Ridge Security 针对 OWASP Juice Shop包含 110 个 CTF 挑战的故意漏洞应用进行了三款工具的对比测试所有工具均使用 Gemini 3 Flash 作为后端模型黑盒条件并采用了三层反作弊机制。工具发现总数有证据支持证据率运行时间RidgeGen5555100%—Shannon271037%—Strix66100%862 秒Strix 在此测试中发现了 6 个有证据支持的漏洞证据率 100%。虽然发现数量不及 RidgeGen但其零幻觉的验证纪律意味着每一个发现都附带完整的利用证据——HTTP 请求、服务器响应、提取的数据和可复现的复现步骤。4.5 与传统安全工具对比根据 AISignal 的性能分析数据Strix 与传统工具的对比如下指标StrixOWASP ZAPBurp Suite漏洞发现率92%78%85%零日漏洞检测67%12%23%误报率8%22%15%代码覆盖率95%82%88%处理速度~45 秒/千行代码5-10 分钟/千行代码—4.6 开发者实战案例独立安全博主 Andrew 在 dev.to 上分享了他的实际使用体验案例 1CI/CD 集成实战在一次小型功能 PR 的快速扫描中Strix 用时 4 分 12 秒消耗约 $0.35 的 Claude API 费用成功捕获了一个真实存在的 XSS 漏洞。案例 2OWASP NodeGoat 扫描对 OWASP NodeGoat故意漏洞的 Node.js 应用进行扫描Strix 发现了 14 个漏洞每一个都包含可复现的 curl 命令、服务器原始响应、修复代码 diff、CVSS 评分和 OWASP 分类。案例 3快速扫描成本参考扫描模式耗时成本适用场景快速扫描Quick约 10 分钟$3 - $5CI/CD PR 检查深度扫描Standard数小时$10 - $20全面安全评估XBEN 单题平均约 19 分钟约 $3.37CTF 挑战五、快速上手指南5.1 环境准备• Docker必须处于运行状态• LLM API Key支持 OpenAI、Anthropic、Google 等主流厂商也支持本地模型Ollama/LMStudio5.2 一键安装# 安装 Strix curl -sSL https://strix.ai/install | bash # 或通过 pipx 安装 pipx install strix-agent5.3 配置与首次扫描# 配置 AI 提供商推荐 GPT-5.4 或 GLM 5.1 export STRIX_LLMopenai/gpt-5.4 export LLM_API_KEYyour-api-key # 扫描本地代码库 strix --target ./app-directory # 扫描 GitHub 仓库 strix --target https://github.com/org/repo # 黑盒 Web 应用评估 strix --target https://your-app.com # 灰盒认证测试 strix --target https://your-app.com \ --instruction Perform authenticated testing using credentials: user:pass # CI/CD 无头模式 strix -n --target https://your-app.com # PR diff 范围扫描仅测试变更代码 strix -n --target ./ --scan-mode quick \ --scope-mode diff --diff-base origin/main5.4 GitHub Actions 集成name: strix-penetration-test on: pull_request: jobs: security-scan: runs-on: ubuntu-latest steps: - uses: actions/checkoutv6 with: fetch-depth: 0 - name: Install Strix run: curl -sSL https://strix.ai/install | bash - name: Run Strix env: STRIX_LLM: ${{ secrets.STRIX_LLM }} LLM_API_KEY: ${{ secrets.LLM_API_KEY }} run: strix -n -t ./ --scan-mode quick推荐使用场景 • 适合应用安全自动化检测、CI/CD 安全门禁、快速渗透测试、Bug Bounty 自动化 • 不适合网络/云基础设施审计、IAM 策略审查、预算极其受限且无法使用顶级模型的场景 • 最佳实践使用 GPT-5.4 或 GLM 5.1 等顶级模型结合 CI/CD diff 扫描作为多层防御的一环 关注我持续分享网安圈硬核干货。觉得有用的话点赞 在看 转发三连支持一下━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━项目地址github.com/usestrix/strix
延伸阅读

更多相关文章

2026/9/19 22:58:32

AI 伪造满天飞,我拿腾讯云 5 个 Skill 搭了台照妖镜

前两天群里有人转来一段视频,说某上市公司老板深夜宣布破产,画面里人脸口型声音都对得上,我盯着看了三遍,愣是没敢说它是真的还是假的,说实话这种事搁三年前我也就回个问号,现在真不行,深度伪造的成本低到离谱,一张图一段视频一段文字,保不齐就不是它看上去的样子,媒体金融招聘…

2026/9/19 22:58:39

计算机发展四阶段:从电子管到AI,理解技术演进脉络

1. 从“算”到“智”:我们为何要回溯计算机的来路?聊计算机基础,很多人第一反应是去背二进制转换、记硬件组成,或者一头扎进某门编程语言的语法里。这当然没错,但就像学开车,你总得先知道汽车是怎么从马车演…

2026/9/23 0:22:20

梦幻祥瑞从零搭建保姆级教程

梦幻祥瑞从零搭建保姆级教程 你是不是也卡在“学会语法却不知怎么搭项目”的坑里?看着文档里的Hello World很兴奋,一到真实场景就懵圈。这篇梦幻祥瑞保姆级教程,专门解决这个痛点。…

2026/9/23 0:22:20

3个技巧搞定滚轮交互:附完整示例与避坑指南

3个技巧搞定滚轮交互:附完整示例与避坑指南 官方文档里关于 wheel 事件的描述往往冗长且充满浏览器兼容性警告,让人抓不住重点。想直接上手写个平滑滚动的轮播图,却总卡在事件节流或默认行为阻止上。这里不堆砌理论,直接给出一套经过生产环境验证…

2026/9/23 0:22:20

情侣扎刀测验感情底层逻辑解析:新手避坑指南

情侣扎刀测验感情底层逻辑解析:新手避坑指南 面试被问原理答不上来,这种尴尬谁没经历过?特别是当面试官盯着你的眼睛,问“这个算法的时间复杂度怎么推导”或者“这个中间件高并发下怎么保证数据一致性”时,脑子瞬间一片空白。很多 新手避坑…

2026/9/23 0:22:20

3个关键帧优化:配置低的网络游戏手写实现渲染引擎

3个关键帧优化:配置低的网络游戏手写实现渲染引擎 看了一堆教程还是不会写项目?问题不在你不够努力,而在于你一直在用“造轮子”的思维去套“填坑”的场景。很多后端转前端,或者刚入行的开发,拿到一个需求就喜欢从头手写实现所有逻辑,哪怕是一个简单的…

2026/9/23 0:17:19

异光录屏入门到精通:3招优化卡顿,告别看教程不会写项目

异光录屏入门到精通:3招优化卡顿,告别看教程不会写项目 看了一堆教程还是不会写项目?这是无数开发者深夜盯着屏幕时的真实写照。你跟着视频敲代码,运行没报错,可一旦换成自己的业务场景,立马就崩。这不是你笨,是你没跨过从“异光录屏”这类工具使用到…

2026/9/22 10:02:42

GAMP 5 基于风险的计算机化系统验证:软件分类与审计追踪实践

简介:《A Risk-Based Approach to Compliant GxP Computerized Systems》即业内熟知的GAMP 5指南,面向制药企业质量与IT合规人员、验证工程师及计算机化系统管理者,用于解决GxP法规环境下系统合规性难以科学落地的问题。文档以风险管理为主线…

2026/9/22 9:07:39

安全托管MSSP实战:从静态防御到人机协同的攻防运营与应急响应

简介:这份PPT围绕互联网业务安全托管服务展开,面向企业安全负责人、IT运维人员及关注MSSP/MSS选型的读者,重点回应传统安全过度依赖人工、碎片化静态防御难以对抗产业化攻击等痛点。资源共1个pptx文件,包体约30.63MB,以…

2026/9/23 0:01:54

3个实战技巧搞定形式英语:从看教程到跑通性能优化

3个实战技巧搞定形式英语:从看教程到跑通性能优化 看了一堆教程还是不会写项目?别慌,这种“眼高手低”的困境在开发者圈子里太常见了。很多人以为卡点在语法,其实真正拦路虎是缺乏将知识点串联成完整链路的能力。今天咱们不聊虚的,直接拿【形式英语】这…

2026/9/22 16:34:32

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/22 20:01:30

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/22 13:25:41

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码