AI Infra入门 之 3个公式算清大模型推理的算力上限与带宽瓶颈

发布时间:2026/9/28 21:13:49

AI Infra入门 之 3个公式算清大模型推理的算力上限与带宽瓶颈 AI Infra 入门3 个公式算清大模型推理的算力上限与带宽瓶颈附 4090 / A100 / H100 手算过程摘要大模型推理慢到底慢在哪本文从最基础的两个公式出发推导出 MFU / MBU 的定义再以「70B 模型 FP8 精度」为例手算 RTX 4090、A100、H100 三张卡的访存时间与计算时间最后给出结论当前大模型推理的瓶颈几乎永远在显存带宽不在算力。关键词AI Infra、MFU、MBU、算力瓶颈、显存带宽、Roofline、存算一体一、分析一个 AI 系统该抓哪几个关键字假设某个任务同时需要保存M字节执行F次浮点计算并通过某个存储接口读写R字节。加速器提供容量M2、计算的吞吐量是A接口的带宽是B。首先任何任务要想跑得起来必须先把数据装进去M M21.1 两个时间项任务的总耗时可以被拆成两个互相独立的时间分量T_compute F / A # 计算时间算力决定 T_memory R / B # 访存时间带宽决定T_compute把所有浮点运算做完需要多久T_memory把需要的数据全部搬运一遍需要多久。1.2 怎么衡量利用率MFU 与 MBU有了两个时间项就可以定义两个业界通用的利用率指标MFU F / (A * T_compute) # Model FLOPs Utilization算力利用率 MBU R / (B * T_memory) # Model Bandwidth Utilization带宽利用率MFU回答的是这段时间里算力单元有多少比例在真正干活MBU回答的是这段时间里显存带宽有多少比例在真正跑数据一个系统最理想的状态就是 MFU 和 MBU 同时无限逼近 1。「优化 AI 系统」本质上就是想办法让这两个数字逼近 1。1.3 常见加速器的硬件上限在动手优化之前先看清天花板在哪。以下是三张常见卡的关键参数显卡显存容量显存带宽BF16 矩阵峰值计算读满显存耗时RTX 409024 GB1.008 TB/s165.2 TFLOP/s0.99 ms/GBA100 80GB SXM80 GB2.039 TB/s312 TFLOP/s0.49 ms/GBH100 80GB SXM80 GB3.35 TB/s989.4 TFLOP/s0.30 ms/GB「读满显存耗时」 显存容量 ÷ 显存带宽表示把整张卡的显存完整读一遍至少需要多长时间。这个数字是后面所有估算的基准尺。二、一个具体例子70B 模型跑在 H100 上2.1 权重文件占多大显存假设条件模型参数量 70B精度 FP8。1B 10 亿 10^9所以参数量为70 × 10^9。FP8 每个参数占1 个字节显存占用 70 × 10^9 × 1 Byte 70 × 10^9 Byte ≈ 70 GB结论FP8 精度下70B 模型的权重约占用 70 GB 显存。顺手记住这个估算表面试和方案设计时非常常用FP32 是参数量 × 4FP16/BF16 是× 2FP8 是× 1。2.2 生成一个 token 大概要多久生成一个 token需要经历两个阶段。第一阶段访存。必须把显存里的权重全部搬到计算单元t_mem 70 GB / 3.35 TB/s 70 / 3350 s ≈ 0.0209 s 20.90 ms第二阶段计算。要怎么估计计算量对于一个向量和矩阵的点积每一个权重都经历了一次乘法 一次加法也就是 2 次浮点运算。所以 70B 参数的模型每生成一个 token 需要2 × 70 × 10^9 140 × 10^9 FLOPs 140 GFLOPs这条规律在业界叫「2N 规则」参数为 N 的模型前向传播一次约需要2N次浮点运算。模型越大需要的浮点计算也越多——注意是线性增长。于是计算时间为T_compute 140 GFLOPs / 989.4 TFLOPs/s 140 × 10^9 / 989.4 × 10^12 ≈ 0.14 ms两阶段对比T_mem 20.90 ms T_compute 0.14 ms两者相差 149 倍。2.3 这个 149 倍意味着什么这是全文最重要的一个推论在T_mem和T_compute相差两个数量级的情况下即使把计算时间优化到 0整体性能提升也不到 1%。换句话说算力优化在这个场景下已经彻底没有收益了。大模型的推理瓶颈根本不在 FLOPS而在显存带宽。这也正是当下存算一体Computing-in-Memory芯片如此兴盛的根本原因——既然瓶颈是「搬数据」而不是「算数据」那就干脆把计算搬进存储里省掉搬运这一步。三、三张卡横向对比T_mem 与 T_compute统一计算条件需要搬运的数据量70 GBFP8 权重需要的运算量2 × 70G 140 GFLOPs显卡显存带宽计算峰值T_memT_compute差距倍数RTX 40901.008 TB/s165.2 TFLOP/s69.44 ms0.85 ms82.0×A100 80GB SXM2.039 TB/s312 TFLOP/s34.33 ms0.45 ms76.5×H100 80GB SXM3.35 TB/s989.4 TFLOP/s20.90 ms0.14 ms147.7×逐项计算过程3.1 RTX 4090T_mem 70 / 1008 s 69.44 ms T_compute 140e9 / 165.2e12 0.85 ms3.2 A100 80GB SXMT_mem 70 / 2039 s 34.33 ms T_compute 140e9 / 312e12 0.45 ms3.3 H100 80GB SXMT_mem 70 / 3350 s 20.90 ms T_compute 140e9 / 989.4e12 0.14 ms3.1 换个视角算术强度Arithmetic Intensity上面的「差距倍数」其实不是巧合它可以用一个更普适的指标解释——算术强度即每搬运 1 字节数据能做多少次浮点运算算术强度 计算量 / 访存量 140e9 / 70e9 2 FLOPs/Byte而每张卡也有自己的机器平衡点Machine Balance机器平衡点 计算峰值 / 显存带宽显卡机器平衡点本任务的算术强度判定RTX 4090165.2 / 1.008 163.9FLOPs/Byte2严重访存受限A100312 / 2.039 153.0FLOPs/Byte2严重访存受限H100989.4 / 3.35 295.3FLOPs/Byte2严重访存受限判定规则算术强度 机器平衡点 → 访存受限Memory Bound反之 → 计算受限Compute Bound。我们的任务算术强度只有2而 H100 的平衡点高达295相差近 150 倍——与前面算出的 147.7 倍几乎完全吻合。三张卡无一例外全部是重度的访存受限。四、结论与延伸4.1 三条可带走的结论大模型推理batch size 1 的 decode 阶段是典型的访存受限任务瓶颈在显存带宽而非算力算力优化收益几乎为零。选卡时先看带宽再看算力。H100 相对 A100 的推理加速很大一部分来自 3.35 TB/s vs 2.039 TB/s 的带宽提升约 1.64×而不是算力的 3.17×。算术强度是判断「卡算力还是卡带宽」的通用工具——先算任务的 FLOPs/Byte再算卡的峰值/带宽比大小即可定性。4.2 几点延伸思考Batch Size 会改变结论上面的2N规则对应 batch size 1。当 batch 增大到 B 时计算量变为2NB而访存量仍是N权重只读一次算术强度随之变成2B。当2B超过机器平衡点时任务就会翻转为计算受限——这正是大 batch 推理能提升吞吐的根本原因也是 Continuous Batching 这类技术有效的理论基础。Prefill 与 Decode 是两种负载本文估算的是 decode逐 token 生成而 prefill 阶段要同时处理整段 prompt计算量随序列长度平方级增长更容易变成计算受限。这也是 PD 分离架构流行的原因。FP8 的算力峰值更高本文表格中的算力峰值取的是 BF16 数值而 H100 的 FP8 Tensor Core 稠密算力约是 BF16 的 2 倍约 1979 TFLOP/s。但即便按 FP8 重算T_compute也只是从 0.14 ms 降到 0.07 ms——瓶颈结论完全不变这本身就是「访存受限」最有力的佐证。如果这篇文章对你有帮助欢迎点赞收藏。下一篇会继续聊 KV Cache 的显存开销与 PagedAttention 的优化思路。
延伸阅读

更多相关文章

2026/9/28 21:13:49

将 Unity 移植到 CoreCLR

关于垃圾收集器的一些情况 C# 语言的内存分配由垃圾回收器管理。在需要分配内存时,分配内存的代码可以在不再使用内存时忽略内存。GC 稍后会过来回收这些内存,供其他代码使用。 Unity 目前使用的是Boehm GC,这是一种保守的、不移动的 GC。它会扫描所有线程栈(包括托管代码…

2026/9/28 22:03:54

弱监督Stacking情感分析实战:不靠海量标注逼近有监督上限

简介:一套基于Stacking框架的弱监督深度学习情感分析研究算法Python完整源码与说明,面向自然语言处理、机器学习方向的学生与研究人员,适合课程设计、毕业设计及项目实战。代码整合了LSTM、CNN、RNN、贝叶斯、SVM等多类模型,并以S…

2026/9/28 22:03:54

Substrate:可定制区块链的模块化底座与Runtime开发实践

1. 项目概述:Substrate不是框架,是区块链的“乐高底盘”如果你最近在技术社区、开发者群或者开源项目讨论里频繁看到substrate这个词,别急着点开文档——先搞清楚它到底是什么,比直接上手写代码重要十倍。简单说,subst…

2026/9/28 22:03:54

毕设级智慧能耗管理系统后端实战:从数据采集到报表

简介:这是一份面向计算机专业毕业设计或课程作业的智慧能耗管理系统后端源码包,适合正在做能耗监控、数据采集与智能化管理项目的学生或开发者参考。系统整合物联网、大数据分析与人工智能技术,可用于学习后端业务逻辑、数据库设计、API接口开…

2026/9/28 22:03:54

Substrate区块链开发:Runtime模块化与链上升级实践

1. Substrate 到底是什么:拆开看它真正解决的三类问题1.1 从"想自己写一条链"说起我记得第一次动念头想自己从零搭一条区块链时,最直观的感受就是:工作量根本不是"写个账本"那么简单的。你至少要把四件事同时搞定——节点…

2026/9/28 22:03:54

AX:本地AI工作流调度引擎原理与工程实践

1. 项目概述:AX不是缩写,而是一个正在成型的开发协作范式“AX”这个词最近在开发者社区里频繁闪现,但它既不是某个新出的AI模型代号,也不是某家科技公司的简称,更不是某种加密货币代码。它本质上是一套围绕本地化智能工…

2026/9/28 21:58:53

Python电商评论情感分析全流程实战:从数据采集到模型训练

简介:基于Python的电商买家评论情感分析项目包,专为毕业设计、期末大作业和课程设计场景打造,代码注释详尽,即使完全没有项目经验的新手也能看懂每一步实现,曾获98分且深受导师认可。整个压缩包约54MB,内含…

2026/9/28 3:03:23

东莞市品牌网站建设报价常见报错与解决

东莞品牌网站建设报价单背后:一份保姆级建站教程避坑实录 网站做好了没人访问,这大概是很多老板最头疼的事。花了大几万做的品牌站,上线后流量惨淡,比路边摊还冷清。别急着骂外包公司,很多“东莞品牌网站建设报价”里藏着不少猫腻,比如用模板站冒充定制…

2026/9/28 6:05:15

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/28 6:07:41

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/9/28 0:02:03

广州外贸网站建设推广:从零搭建全流程拆解与真实报价避坑

广州外贸网站建设推广:从零搭建全流程拆解与真实报价避坑 改个需求建站公司拖一周,后台改个文案还得再交一笔“技术维护费”。这种憋屈事儿,做外贸的朋友太熟悉了。很多老板在找广州外贸网站建设推广服务商时,光盯着首页好不好看,却忽略了从零搭建一个能…

2026/9/28 0:02:04

搞懂百度竞价推广价格,网站性能优化别掉链子

搞懂百度竞价推广价格,网站性能优化别掉链子 网站突然打不开,浏览器弹出红色警告“此网站存在安全风险”,后台一看全是乱码代码和奇怪的跳转链接。这种网站被黑挂马的绝望感,很多刚转行做网站的朋友都经历过,尤其是那些为了省几百块钱服务器费用的新手。…

2026/9/25 20:55:38

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/26 19:58:38

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/28 1:59:25

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑