发布时间:2026/8/25 6:49:37
AI芯片架构大揭秘:英伟达GPU与谷歌TPU的设计、扩展及软件全解析 AI芯片架构2018年国际计算机体系结构研讨会上约翰·轩尼诗和大卫·帕特森发表图灵讲座《计算机体系结构的新黄金时代》。20世纪80年代轩尼诗和帕特森开展获图灵奖研究时单线程CPU性能年增长52%到2018年降至3%。特定领域架构应运而生以谷歌TPU v1为例其在神经网络推理方面吞吐量是CPU29倍能效高80倍。他们预测未来十年新型计算机体系结构将迎来寒武纪大爆发如今有数十种架构正大力研发专注AI计算。已实现实际部署的架构有GPU、脉动阵列加速器、Cerebras晶圆级引擎和Groq LPU。英伟达领先AMD紧随OpenAI和Meta向AMD下达6GW订单。TPU用于训练Gemini还将为Anthropic提供芯片Anthropic在Trainium芯片上运行Claude。Cerebras为OpenAI提供推理服务Groq LPU并入英伟达。问题所在AI计算主要由矩阵乘法主导Transformer模型是一系列矩阵乘法运算。训练前沿模型需执行10^25次乘加运算。矩阵乘法形式取决于工作负载训练和预填充是大规模矩阵 - 矩阵乘法计算强度高解码阶段是矩阵 - 向量乘法计算强度下降。推理系统通过批处理将GEMV运算转换为GEMM运算提高计算强度。架构问题是“内存墙”问题即计算能力增长而内存带宽跟不上。每种架构针对数据移动问题有不同策略。英伟达GPU英伟达GPU是大规模并行处理器设计理念是可编程芯片在主机CPU协调下通过CUDA编程适合运行可并行化工作负载。每代产品在流多处理器上添加加速原语不改变编程模型同芯片可用于多种场景。发展历程2006 - 2027年有多代架构和型号如2006年Tesla架构G802027年Rubin Ultra架构等。架构由面向吞吐量的核心、深层内存层次结构和少量调度硅芯片组成。核心是流多处理器每个芯片封装有多个SM。每个SM内部结构相同包含四个子分区共享L1/共享内存块和张量内存加速器。线程组织成线程束同步执行。计算CUDA核心负责除矩阵乘法外的操作绝大部分计算吞吐量来自张量核心。张量核心执行融合矩阵乘加运算不同代产品的张量核心功能不断提升矩阵乘法对发出指令的线程依赖减小提高了Transformer注意力内核执行效率。内存片上内存层次结构由硬件管理缓存结合软件提示片外是HBM。不同层次数据移动逐渐与线程束解耦每代产品让线程束操作减少。线程束专业化Hopper时代编程习惯是线程束专业化通过mbarrier和异步事务屏障实现细粒度生产者/消费者握手成为现代注意力内核参考标准。数值精度FP32曾是默认精度各代产品不断降低精度并采用缩放方案恢复精度同时集成更多硅芯片提高每瓦吞吐量。设计理念包括可编程性、通过大规模多线程隐藏延迟、线程束封装的矩阵乘法、异步内存层次结构、分摊SIMT开销。扩展有纵向扩展和横向扩展两种方式。纵向扩展将多个GPU绑定到一致内存域可直接通过NVLink访问其他GPU的HBM。纵向扩展架构由NVLink和NVSwitch组成定义了HGX 8 - GPU主板等多种形式。高密度连接依赖无源铜不同代产品在纵向扩展上不断升级。横向扩展在机架和集群级别连接内存域数据通过RDMA传输。横向扩展架构源于英伟达对Mellanox收购不同代产品在横向扩展带宽等方面有提升。从铜缆到光纤转换发生在机架边界Rubin推出后光学层集成到交换机ASIC中。NVLink Fusion开放纵向扩展网络。软件CUDA是编程模型开发者编写内核在多线程上启动。每代新产品引入新硬件并在PTX和SASS中暴露。软件栈包括cuBLAS、cuDNN、CUTLASS等。FlashAttention针对英伟达芯片手动优化。软件栈大部分由英伟达之外的人编写英伟达还提供专业技术支持。谷歌TPUTPU是矩阵乘法机器设计理念是专注密集矩阵乘法让XLA编译器提前规划内存使用。每代产品扩大集群规模用于训练和服务谷歌工作负载。发展历程2015年TPU v12017年TPU v2等。

相关新闻

2026/8/25 6:49:37

腾讯开源WeKnora:企业级RAG框架的模块化设计与工程实践

1. 项目概述:WeKnora,一个被低估的开源知识库引擎最近在技术圈里,一个名为 WeKnora 的项目突然火了起来,GitHub 上迅速斩获了超过 13.7K 的 Star。更让人惊讶的是,它的背后是腾讯。通常,大厂开源的多是些前…

2026/8/25 6:49:37

告别C盘空间焦虑:从原理到实践的Windows系统化清理策略

你的电脑C盘是不是又红了?每次看到那个刺眼的红色进度条,是不是既焦虑又无奈?删几个文件杯水车薪,用清理软件又怕误删系统文件或捆绑一堆垃圾软件。这几乎是每个Windows用户,无论是技术小白还是资深开发者,…

2026/8/25 6:49:37

QClaw自动化工具在世界杯预测市场的1000元量化实验

1. 项目概述:当世界杯遇上预测市场,一个普通人的“小赌注”实验最近,一个叫QClaw的工具在圈内讨论度挺高,尤其是在Polymarket这类预测市场平台上。碰巧美加墨世界杯临近,各种预测合约层出不穷。我手头正好有1000块闲钱…

2026/8/25 8:55:21

FreeRTOS任务创建详解:从xTaskCreate参数到调度原理

1. 为什么“创建任务”是FreeRTOS入门的第一道门槛FreeRTOS不是一块板砖,而是一套精密运转的微型操作系统内核。很多人刚接触时以为“写个while(1)循环不就完事了”,结果一上手就卡在第一个函数——xTaskCreate()。这背后根本不是语法问题,而…

2026/8/25 8:55:21

大模型面试必问:KV-Cache机制解析与优化

1. 为什么大模型面试必问KV-Cache机制?这个问题几乎出现在所有大模型相关岗位的技术面试中,根本原因在于KV-Cache直接关系到推理效率这个核心生产指标。当面试官抛出这个问题时,实际上是在考察候选人对以下三个维度的理解深度:自回…

2026/8/25 1:04:19

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/24 1:12:32

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/24 8:17:29

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/25 0:04:14

三步把QQ空间历史说说导出到本地:GetQzonehistory 极简指南

三步把QQ空间历史说说导出到本地:GetQzonehistory 极简指南 【免费下载链接】GetQzonehistory 获取QQ空间发布的历史说说 项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory Meta Description:GetQzonehistory 是一个QQ空间历史说…

2026/8/25 0:04:14

洛谷 P7912:[CSP-J 2021 T4] 小熊的果篮 ← 双向链表

【题目来源】 https://www.luogu.com.cn/problem/P7912 【题目描述】 小熊的水果店里摆放着一排 n 个水果。每个水果只可能是苹果或桔子,从左到右依次用正整数 1,2,…,n 编号。连续排在一起的同一种水果称为一个“块”。小熊要把这一排水果挑到若干个果篮里&#x…

2026/8/24 13:42:17

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/24 18:13:48

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/25 1:08:14

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…