发布时间:2026/8/27 8:16:44
5分钟跑通 gpu-burn:多GPU压力测试与稳定性验证 5分钟跑通 gpu-burn多GPU压力测试与稳定性验证【免费下载链接】gpu-burnMulti-GPU CUDA stress test项目地址: https://gitcode.com/gh_mirrors/gp/gpu-burngpu-burn 是一款基于 CUDA 的多 GPU 压力测试工具。它会在机器上的所有 NVIDIA GPU 上并行跑计算内核边施加高负载边校验计算结果的正确性并按卡报告错误数量。如果你需要为 GPU 做稳定性验证、新机验收或故障定位这一个工具就能覆盖大部分常见需求。它的负载来自大量浮点读比较操作每个线程反复比较一个数组中的元素差值超过阈值就计为一个坏元素发热和验证正确性因此同时发生。克隆、编译、跑一次 5 分钟压测首次上手只需三步全部走默认选项。先拉取源码。项目很小编译只依赖本机的 CUDA 工具包。git clone https://gitcode.com/gh_mirrors/gp/gpu-burn cd gpu-burn拉取成功后本地会出现 gpu-burn 目录后续步骤都在该目录内执行。接着编译。Makefile 会自动探测 /usr/local/cuda 或 /usr 下的 CUDA默认按计算能力 7.5Turing编译。make编译成功后目录中会生成gpu_burn可执行文件和内核产物compare.fatbin整个过程通常在一分钟以内。最后对所有 GPU 跑一次压测末尾的 300 是持续秒数显存默认按可用量的 90% 分配。./gpu_burn 300结束时程序会打印每张卡达到的 GFLOPS 与坏元素数量各卡均为 0 errors 即算通过。运行时参数速查表参数以gpu_burn [OPTIONS] [TIME]形式传入TIME 为秒数参数作用示例备注TIME测试时长秒./gpu_burn 600缺省时持续运行直到手动停止-m X使用 X MB 显存./gpu_burn -m 4096 600适合按固定显存量测试-m N%使用 N% 可用显存./gpu_burn -m 80% 600百分比形式默认 90%-d双精度浮点测试./gpu_burn -d 3600GFLOPS 较低同时验证双精度计算-tc尝试使用 Tensor 核心./gpu_burn -tc 300仅在支持的卡上生效-l列出系统所有 GPU./gpu_burn -l打印后即退出便于确认编号-i N只在第 N 张卡上运行./gpu_burn -i 2 1800定位单张可疑卡-h显示帮助信息./gpu_burn -h—按 GPU 架构指定 COMPUTE 编译默认编译目标是 compute_75。机器上的卡如果是更新架构建议显式指定 COMPUTE否则预编译产物可能与卡不匹配架构典型卡COMPUTETuringRTX 20 系75AmpereRTX 30 系 / A10086AdaRTX 40 系89HopperH10090BlackwellB 系120make COMPUTE86需要多架构 fat binary 时把 COMPUTE 置空并通过NVCCFLAGS传入-gencode其余变量CUDAPATH、LDFLAGS 等见 Makefile。容器化构建不想改动宿主机的 CUDA 环境时可以直接用仓库自带的 Dockerfile通过 build args 指定 CUDA 版本、计算能力与基础镜像docker build --build-arg CUDA_VERSION13.0.0 --build-arg COMPUTE75 --build-arg IMAGE_DISTROubi8 -t gpu-burn .运行时把全部 GPU 挂进容器即可输出与判读和宿主机一致docker run --rm --gpus all gpu-burnWindows 版本win/ 目录是 Windows 移植版改用 CMake 与 Visual Studio 构建压测行为与 Linux 版一致CUDA 内核与主目录共享。cd win build.bat -c 89产物位于build\Release\gpu_burn.exe接受的参数与 Linux 版相同。两个典型用法新服务器验收长时间满载现象收到新多卡机器交付前需要确认每张卡都能长时间扛住满载。操作先列出显卡确认数量与编号再启动 24 小时双精度压测。./gpu_burn -l ./gpu_burn -d 86400判读-d模式下 GFLOPS 明显低于单精度属正常重点看结束时报错是否为 0以及 nvidia-smi 中各卡显存与功耗是否全程保持高位。定位可疑卡单卡压测现象作业偶发在某张卡上报错想单独复现。操作列出显卡确认编号后用-i锁定可疑卡同时用-m限制显存减少干扰。./gpu_burn -i 2 -m 80% 1800判读30 分钟内复现错误说明该卡内存或计算单元存在隐患未复现可改用-d再验证或延长时长。排错与监控编译时找不到 CUDA工具链装在非标准位置时编译时直接指定路径make CUDAPATH/usr/local/cuda-12.0仍报错时先用which nvcc确认工具链是否真正安装。配合 nvidia-smi 监控怎么看另开终端执行watch -n 1 nvidia-smi压测期间 GPU-Util 应接近 100%显存占用与-m设定一致温度爬升到平台期后稳定。若 Util 持续偏低通常是负载未打满例如显存被其他进程挤占或容器未挂到对应 GPU。测试中温度偏高压力测试温度普遍高于日常训练负载。某张卡接近功耗墙温度常见约 83~88°C视卡而定时可用-m 50%降低显存占用或缩短时长只要错误数保持为 0结论不受影响。最短启动方式是./gpu_burn 300其余参数见./gpu_burn -h、README.md 与手册页 gpu-burn.8。【免费下载链接】gpu-burnMulti-GPU CUDA stress test项目地址: https://gitcode.com/gh_mirrors/gp/gpu-burn创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/8/27 8:16:43

基于LSTM的网络异常流量预测实战:时间序列建模与异常检测

之前在项目里做网络流量监控时,流量数据波动大、攻击特征隐蔽,一套固定阈值规则根本扛不住业务的动态变化,误报和漏报交替出现。后来把方向转向 LSTM 这类循环神经网络,利用它对时间序列的建模能力来做流量预测,再基于…

2026/8/27 8:11:42

现代前端框架实战(4):状态管理方案选型

上一篇让项目与筛选进入 URL,本篇继续整理任务看板的状态边界。重点不是比较库的热度,而是先给状态分类,再用所有权、更新频率、持久化与一致性要求选择局部 state、URL、Context、外部 store 或请求缓存。 一、痛点:全局状态常是…

2026/8/27 8:11:42

BOM定价优化:从物料清单到成本优化的工程化实践

这次我们来看一个供应链和研发侧都绕不开的话题:BOM 定价优化。项目名字叫Make It Cheaper - BOM Pricing Optimizer,从定位上看,它是一个面向硬件产品 BOM(物料清单)的成本分析与价格优化工具,核心目标是帮…

2026/8/27 10:01:59

Tracealyzer 3.1 USB Trace Streaming 实战:从原理到排错

调试 FreeRTOS 任务卡死的时候,我最怕的就是手里只有几个变量,看不出上下文。打断点又怕改变时序,加日志又担心把现象冲没了,这种时候能有一段完整的 trace 回放,比什么都值钱。所以 Percepio Tracealyzer 这类工具在 …

2026/8/27 10:01:59

宽压DC-DC模块:小封装下的宽电压范围设计与应用指南

宽压DC-DC模块这两年出镜率越来越高,前段时间做一款现场采集设备时感触特别深——项目初期按24V标称电压设计供电,结果现场实测电压在18V到30V之间反复跳,甚至启动瞬间还能冲到36V,板卡上的分立式降压方案直接掉链子。后面换成一款…

2026/8/27 10:01:59

车企集体回归实体按键?触屏和按键到底该要哪个?

这些年,伴随着新能源汽车智能座舱的普及,以中控大屏取代实体按键已经在特斯拉的带领下成为了一种大势所趋,但是就在这个趋势已经被大家默认的时候,不少车企又开始宣布回归实体按键,触屏和按键到底该要哪个?…

2026/8/27 10:01:59

嵌入式SOM异构多核方案:Linux+RTOS实时设计与核间通信实践

1. 项目概述与整体方案设计 1.1 核心需求解析:为什么是SOM,为什么是LinuxRTOS 这两年嵌入式项目越来越复杂,一个显著趋势就是“模块化算力”——不再像以前那样画一块大板子把所有芯片堆上去,而是把CPU、内存、存储、电源管理这些…

2026/8/27 9:56:58

大模型API峰谷定价应对:多模型网关接入与成本护栏实践

大模型API峰谷定价应对:多模型网关接入与成本护栏实践 问题背景 2026 年 8 月 17 日 0 点起,DeepSeek 对 V4 系列(V4 Pro 0813、V4 Flash 0731)启用峰谷分时计费。每天 9:00–12:00、14:00–18:00 为高峰,其余为闲时&a…

2026/8/26 9:13:28

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/25 11:48:27

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/27 7:46:21

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/27 0:01:16

Go语言构建企业级AI服务网关:统一管理英伟达等AI接口调用

1. 项目概述:从零构建一个企业级的AI服务网关 最近在帮一个做内容审核的团队做技术架构升级,他们原来的业务里,每天有几十万张图片和短视频需要过审,最初是接了几个开源的AI模型自己部署,但效果和性能一直不太稳定。后…

2026/8/27 0:01:16

LeetCode Hot100(51-60)算法精解与面试技巧

1. 题目背景与核心价值"hot100(51-60)"这个标题看起来像是某个编程题库或算法练习集中的一组题目编号。在技术社区中,类似命名通常指向LeetCode、牛客网等平台的热门题目集合。作为刷过300题的算法老手,我理解这类题目的核心价值在于&#xff…

2026/8/27 0:01:16

CRC校验实战:从模2除法到HJ212协议排错

1. 为什么一个“校验码”能扛住工业现场90%的数据 corruption? 你有没有遇到过这样的场景:嵌入式设备通过RS-485上传温湿度数据,上位机偶尔收到一帧乱码——温度显示成-273℃,湿度跳到999%,但串口波形看起来完全正常&a…

2026/8/26 19:34:06

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/26 19:17:08

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/26 19:34:05

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…