发布时间:2026/8/7 6:57:20
近期爆火!Strix自动挖掘漏洞,配合GPT最新模型速度和质量双爆炸 Strix让 AI 替你做渗透测试的开源神器—— 43,000 Star96% 基准测试通过率AI 驱动的自动化白帽审计━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━一、为什么我们需要关注 Strix在传统的应用安全测试中我们面临一个两难选择• 静态扫描器SAST速度快但误报率高达 20% 以上安全工程师要花大量时间做漏洞确认• 手动渗透测试准确率高但周期动辄数周成本也高得吓人• 动态扫描器DAST介于两者之间但覆盖面有限尤其对业务逻辑漏洞无能为力。Strix 的出现试图用 AI Agent 打破这个困局——它不是简单地用大模型跑 nmap而是把渗透测试的纪律性编码进了 Agent 的系统提示和工具契约里先侦察再测、必须 PoC 验证、漏报不算数、只有专门 Agent 才能报漏洞。核心卖点每一个发现的漏洞都附带可复现的概念验证PoC只有验证成功的漏洞才会输出大幅降低无效告警。二、Strix 是什么Strix 是一款开源的 AI 自动化渗透测试工具采用 Apache 2.0 协议目前在 GitHub 上已获得超过 43,000 颗 Star。给定目标代码目录、GitHub 仓库或线上地址它会启动一组 AI Agent像真人黑客一样去跑程序、找漏洞、写 PoC 验证最后输出可直接用于整改的测试报告。项目基本信息项目详情GitHub 仓库github.com/usestrix/strix开源协议Apache 2.0PyPI 包名strix-agentGitHub Stars43,000提交数量674 次最新版本v0.6.0持续更新中初始开源日期2025年8月9日在线平台app.strix.ai文档地址docs.strix.ai三、核心架构多智能体协同作战Strix 采用 Graph of Agents代理图多代理编排架构侦察、利用、后渗透阶段由专属 AI Agent 分工协作支持多目标并行扫描、漏洞链式串联利用还原真实红队作业模式。3.1 Agent 工具箱Strix Agent 在 Docker 沙箱中能调用的工具集和真人 Pentester 用的是同一套工具模块能力说明HTTP 拦截代理深度集成 Caido全量请求/响应拦截与分析适合复现和篡改交互浏览器自动化Playwright 驱动多标签页环境测 XSS/CSRF/点击劫持/认证绕过等前端场景终端环境交互式 Shell沙箱内执行 Kali 工具模拟攻击链Python 运行时写自定义 Exploit 并当场跑快速做概念验证PoC侦察模块自动化 OSINT 攻击面测绘、子域名枚举、指纹识别代码分析SAST DAST 结合semgrep 等工具做白盒分析主动探测做黑盒分析漏洞知识库结构化 findings带 CVSS 评分和 OWASP 分类3.2 漏洞覆盖面Strix 的 skills/vulnerabilities/ 目录下有 23 个漏洞类型的知识包覆盖 OWASP Top 10 及以外漏洞类别代表漏洞注入攻击SQL 注入、NoSQL 注入、SSTI、OS 命令注入、HTTP 请求走私服务端漏洞SSRF、XXE、不安全反序列化、RCE、路径穿越/LFI/RFI客户端攻击XSS存储型/反射型/DOM 型、CSRF、原型链污染、开放重定向访问控制IDOR、功能级授权绕过BFLA、大规模赋值业务逻辑竞态条件、支付操纵、工作流绕过认证与会话JWT 攻击、会话固定、子域接管、信息泄露API 安全认证失效、批量赋值、速率限制绕过基础设施配置错误、云元数据暴露、服务暴露四、实际测试成绩重点以下测试数据均来自公开的独立测评和基准测试非官方营销数据。4.1 XBEN 基准测试96% 通过率XBEN 是一个包含 104 个真实世界 Web 安全挑战的 CTF 格式基准测试平台。在独立测评中Strix 的表现如下指标成绩总挑战数104 个成功解决100 个通过率96%平均每题耗时约 19 分钟总测试成本$337单题平均成本约 $3.37误报率趋近于零PoC 验证机制关键对比在同场测试中独立安全研究机构 Escape 的测评指出Strix 和另一个 Agent 能够交付可操作的结果确认关键漏洞并生成 PoC 利用代码而多个竞品PentAGI、PentestGPT 等遭遇了设置或执行失败根本无法完成测试。4.2 18 个大模型横评谁最适合做渗透测试安全研究员 TheArtificialQ 花了近 100 小时使用 Strix v0.8.3 对 18 个不同的 LLM 模型进行了黑盒渗透测试横评。测试目标是一台包含 14 个漏洞的靶机服务器CVSS 评分从 4.8 到 9.9满分 105.2 分每个模型测试 3 次取平均分。测试结果排名按平均分从高到低排名LLM 模型平均分备注1GLM 5.1智谱61.1冠军长程代理任务表现最佳分数范围 53.9-70.52GPT-5.4OpenAI~45-50亚军但倾向于过早收手3Sonnet 4.6Anthropic40.8分数尚可但单次测试成本高达 $55.94step-3.5-flash~35-38小模型梯队第一曾免费可用5kimi-k2.5月之暗面~35-37小模型梯队第二性价比高6gemma-4-31b-it~25-28最小模型表现尚可7deepseek-v3.2~25-28令人失望与 gemma-4 持平但贵 2 倍8grok-4.200 分完全无效拒绝执行渗透测试9nemotron-3-super0 分NVIDIA 模型未得分关键发现① 认真做渗透测试必须用大模型大且贵的模型。便宜模型集中在同一 mediocre 区间而真正拉开差距的模型都明显更贵。② Anthropic 模型的缺席之谜Sonnet 4.6 通过 Claude APITier 1测试时2 小时内触发 105 次 超过 30,000 输入令牌/分钟速率限制 错误仅发现 1 个漏洞就烧掉了 $20。通过 OpenRouter 绕过限制后单次测试成本高达 $55.9约为 GPT-5.4 的 3 倍。③ GLM 5.1 的意外夺冠这款发布仅一周的模型在长程代理任务中表现最佳其设计定位long-horizon agentic work与渗透测试的多步骤推理需求高度契合。4.3 Duck Store 多工具对比测试01webmasters 对 5 款 AI 渗透测试工具进行了灰盒条件下的基准对比测试。测试目标为 Duck Store——一个故意设计为存在 20 个已知漏洞的 Web 应用React 前端 FastAPI 后端覆盖注入、SSRF、XSS、IDOR、业务逻辑、访问控制、认证缺陷、信息泄露、开放重定向等类别。工具底层模型发现漏洞检测率运行时长误报率Escape专有模型15/2075.0%4 小时6.25%ClaudeOpus 4.614/2070.0%10 分钟6.67%PentAGIDeepSeek v3.29/2045.0%4 小时10.00%ShannonDeepSeek v3.26/2030.0%6 小时25.00%StrixDeepSeek v3.21/205.0%2 小时0.00%重要分析• Strix 在此测试中仅检测到 1 个漏洞产品过滤器中的未认证 SQL 注入检测率最低。但值得注意的是其误报率为 0%——虽然样本量太小但印证了 PoC 验证机制的有效性。• 使用相同模型DeepSeek v3.2的三个工具表现差异巨大PentAGI 45% Shannon 30% Strix 5%。这表明工具的编排层orchestration layer——代理动作循环结构、工具调用管理和认证处理——是决定性能的关键变量模型选择反而是次要考虑。注意该测试仅运行一次未取多次平均值。Strix 使用的是 DeepSeek v3.2 这一较弱的模型而非推荐的 GPT-5.4 或 GLM 5.1。结合 18 模型横评数据Strix 配合顶级模型时表现显著提升。4.4 OWASP Juice Shop 实战对比Ridge Security 针对 OWASP Juice Shop包含 110 个 CTF 挑战的故意漏洞应用进行了三款工具的对比测试所有工具均使用 Gemini 3 Flash 作为后端模型黑盒条件并采用了三层反作弊机制。工具发现总数有证据支持证据率运行时间RidgeGen5555100%—Shannon271037%—Strix66100%862 秒Strix 在此测试中发现了 6 个有证据支持的漏洞证据率 100%。虽然发现数量不及 RidgeGen但其零幻觉的验证纪律意味着每一个发现都附带完整的利用证据——HTTP 请求、服务器响应、提取的数据和可复现的复现步骤。4.5 与传统安全工具对比根据 AISignal 的性能分析数据Strix 与传统工具的对比如下指标StrixOWASP ZAPBurp Suite漏洞发现率92%78%85%零日漏洞检测67%12%23%误报率8%22%15%代码覆盖率95%82%88%处理速度~45 秒/千行代码5-10 分钟/千行代码—4.6 开发者实战案例独立安全博主 Andrew 在 dev.to 上分享了他的实际使用体验案例 1CI/CD 集成实战在一次小型功能 PR 的快速扫描中Strix 用时 4 分 12 秒消耗约 $0.35 的 Claude API 费用成功捕获了一个真实存在的 XSS 漏洞。案例 2OWASP NodeGoat 扫描对 OWASP NodeGoat故意漏洞的 Node.js 应用进行扫描Strix 发现了 14 个漏洞每一个都包含可复现的 curl 命令、服务器原始响应、修复代码 diff、CVSS 评分和 OWASP 分类。案例 3快速扫描成本参考扫描模式耗时成本适用场景快速扫描Quick约 10 分钟$3 - $5CI/CD PR 检查深度扫描Standard数小时$10 - $20全面安全评估XBEN 单题平均约 19 分钟约 $3.37CTF 挑战五、快速上手指南5.1 环境准备• Docker必须处于运行状态• LLM API Key支持 OpenAI、Anthropic、Google 等主流厂商也支持本地模型Ollama/LMStudio5.2 一键安装# 安装 Strix curl -sSL https://strix.ai/install | bash # 或通过 pipx 安装 pipx install strix-agent5.3 配置与首次扫描# 配置 AI 提供商推荐 GPT-5.4 或 GLM 5.1 export STRIX_LLMopenai/gpt-5.4 export LLM_API_KEYyour-api-key # 扫描本地代码库 strix --target ./app-directory # 扫描 GitHub 仓库 strix --target https://github.com/org/repo # 黑盒 Web 应用评估 strix --target https://your-app.com # 灰盒认证测试 strix --target https://your-app.com \ --instruction Perform authenticated testing using credentials: user:pass # CI/CD 无头模式 strix -n --target https://your-app.com # PR diff 范围扫描仅测试变更代码 strix -n --target ./ --scan-mode quick \ --scope-mode diff --diff-base origin/main5.4 GitHub Actions 集成name: strix-penetration-test on: pull_request: jobs: security-scan: runs-on: ubuntu-latest steps: - uses: actions/checkoutv6 with: fetch-depth: 0 - name: Install Strix run: curl -sSL https://strix.ai/install | bash - name: Run Strix env: STRIX_LLM: ${{ secrets.STRIX_LLM }} LLM_API_KEY: ${{ secrets.LLM_API_KEY }} run: strix -n -t ./ --scan-mode quick推荐使用场景 • 适合应用安全自动化检测、CI/CD 安全门禁、快速渗透测试、Bug Bounty 自动化 • 不适合网络/云基础设施审计、IAM 策略审查、预算极其受限且无法使用顶级模型的场景 • 最佳实践使用 GPT-5.4 或 GLM 5.1 等顶级模型结合 CI/CD diff 扫描作为多层防御的一环 关注我持续分享网安圈硬核干货。觉得有用的话点赞 在看 转发三连支持一下━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━项目地址github.com/usestrix/strix

相关新闻

2026/8/7 6:57:20

AI 伪造满天飞,我拿腾讯云 5 个 Skill 搭了台照妖镜

前两天群里有人转来一段视频,说某上市公司老板深夜宣布破产,画面里人脸口型声音都对得上,我盯着看了三遍,愣是没敢说它是真的还是假的,说实话这种事搁三年前我也就回个问号,现在真不行,深度伪造的成本低到离谱,一张图一段视频一段文字,保不齐就不是它看上去的样子,媒体金融招聘…

2026/8/7 6:52:20

计算机发展四阶段:从电子管到AI,理解技术演进脉络

1. 从“算”到“智”:我们为何要回溯计算机的来路?聊计算机基础,很多人第一反应是去背二进制转换、记硬件组成,或者一头扎进某门编程语言的语法里。这当然没错,但就像学开车,你总得先知道汽车是怎么从马车演…

2026/8/7 7:42:24

Python 类的多继承与 Tkinter 模块入门指南

1. Python 类的多继承多继承是面向对象编程中的一个重要特性,它允许一个类同时继承多个父类。Python 完全支持多继承,这为代码复用和设计模式提供了更大的灵活性。1.1 基本语法在 Python 中,多继承的语法非常简单,只需要在类定义时…

2026/8/7 7:42:24

2026最新视频重点整理工具口碑推荐 | 经过筛选的实用选择建议

2026年经过筛选的视频重点整理实用工具中,听脑在录音类视频的重点提取整理场景适配度靠前,其余工具各有对应适配场景。适合需要整理会议、访谈、课堂类视频重点的效率工具爱好者,核心依据是其覆盖从转写到重点提取、待办梳理的完整流程。不适…

2026/8/7 7:37:24

零代码AI技能开发实战:从QClaw到微信生态的“恋爱大师”

1. 从“技术玩具”到“情感助手”的意外转型 去年年底,我偶然接触到了QClaw这个低代码AI技能开发平台。当时的心态很纯粹,就是想找个周末项目练练手,看看能不能把一些天马行空的想法快速落地。作为一个在技术圈摸爬滚打多年的“老油条”&…

2026/8/7 7:37:24

AI大模型流式输出:SSE协议为何优于WebSocket与WebRTC?

1. 项目概述:AI大模型实时通信的技术选型之争最近在设计和实现几个AI大模型应用的后端服务时,我反复被一个看似基础、实则关键的问题所困扰:如何为AI大模型的实时文本流输出选择最合适的通信协议?无论是构建一个类ChatGPT的对话应…

2026/8/5 3:13:11

如何用免费工具突破游戏窗口限制:SRWE完整使用指南

如何用免费工具突破游戏窗口限制:SRWE完整使用指南 【免费下载链接】SRWE Simple Runtime Window Editor 项目地址: https://gitcode.com/gh_mirrors/sr/SRWE 你是否遇到过这样的困扰?想为心爱的游戏截图,却发现游戏不支持自定义分辨率…

2026/8/7 0:01:55

CAD图库管理:从文件归档到设计资产管理的效率革命

你肯定遇到过这种情况:打开一个老项目,想找某个特定的图块——比如一个标准的门、一个特定的设备符号,或者一个公司logo。你记得它就在某个DWG文件里,或者曾经从某个同事那里拷来过。于是,你开始在一堆命名混乱的文件夹…

2026/8/7 0:01:55

5分钟掌握Wand-Enhancer:2026年终极WeMod专业版免费解锁指南

5分钟掌握Wand-Enhancer:2026年终极WeMod专业版免费解锁指南 【免费下载链接】Wand-Enhancer Advanced UX and interoperability extension for Wand (WeMod) app 项目地址: https://gitcode.com/GitHub_Trending/we/Wand-Enhancer Wand-Enhancer是一款功能强…

2026/8/7 0:01:55

“Quality Control(质量控制)”在软件工程中通常指通过一系列活动确保软件产品符合预定的质量标准和用户需求

“Quality Control(质量控制)”在软件工程中通常指通过一系列活动确保软件产品符合预定的质量标准和用户需求。而“软件测试”是质量控制的关键手段之一,属于QC范畴下的具体实践,其目标是发现缺陷、验证功能正确性、评估软件质量属…

2026/8/5 19:21:13

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/5 19:21:13

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/6 20:45:01

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…