深度拆解昇腾950DT NPU微架构:为千卡超节点设计的大模型训练专用芯片

发布时间:2026/10/8 7:08:06

深度拆解昇腾950DT NPU微架构:为千卡超节点设计的大模型训练专用芯片 深度拆解昇腾950DT NPU微架构:为千卡超节点设计的大模型训练专用芯片深度拆解昇腾 950DT NPU 微架构:为千卡超节点设计的大模型训练专用芯片作者注:本文所有技术参数均来自 WAIC2026 华为昇腾技术分论坛公开披露信息,作者基于 20 年 ICT 软硬件架构经验做技术拆解,内容仅供学习研究参考。引言在 WAIC2026 上发布的昇腾 950 SuperPoD 超节点,核心是代号为 950DT 的新一代 NPU 芯片。和上一代昇腾 910B 面向通用 AI 计算场景的设计思路不同,950DT 从立项之初就瞄准千卡级超节点的大模型训练场景,不再单纯追求单卡理论算力的堆砌,而是从计算核心、存储层次、片间互联、硬件加速、软件协同全栈做全局优化,解决传统分布式集群 “通信墙”“内存墙” 的核心痛点。对于开发者而言,理解 950DT 的微架构设计,不仅能更好地做算子优化和性能调优,也能看到国产 NPU 从 “单卡性能跟随” 到 “系统级架构创新” 的思路转变。本文将从计算核心、存储子系统、互联架构、专用加速模块、软件协同几个维度,对 950DT 做全面的技术拆解。一、达芬奇架构 3.0:重构大模型训练的计算核心950DT 采用升级后的达芬奇 3.0 架构,针对大模型训练的计算特征做了针对性的计算单元重构,而不是在原有架构上做简单的工艺升级和频率提升。1.1混合精度张量核心升级大模型训练已经全面进入 FP8/FP4 混合精度时代,950DT 在每个 AI Core 中集成了专用的 FP8/FP4 张量计算单元,支持 E4M3/E5M2 两种 FP8 格式和多种 FP4 编码格式,单芯片 FP8 理论算力达到 1PFLOPS,FP4 理论算力达到 2PFLOPS,相比上一代 910B 提升了 2.5 倍。和其他 NPU 不同的是,950DT 的张量
延伸阅读

更多相关文章

2026/10/6 21:07:18

TVA-World架构:开启具身智能时代新纪元(12)

引言:AI智能体视觉(TVA,Transformer-based Vision Agent)是依托Transformer架构与“因式智能体”理论所构建的颠覆性工业视觉技术,是集深度强化学习(DRL)、卷积神经网络(CNN&#xf…

2026/9/19 12:16:05

Git单仓库(Monorepo)迁移实践与优化策略

1. 多仓库管理的痛点与单仓库优势解析在软件开发领域,Git多仓库管理是许多团队长期采用的工作模式。我经历过一个典型场景:某金融科技系统由12个微服务组成,每个服务独立仓库,加上前端框架、公共组件和文档仓库,总共有…

2026/10/7 22:45:37

GitHub镜像站搭建指南:提升代码仓库访问速度

1. GitHub镜像站搭建背景与价值 国内开发者在使用GitHub时经常遇到clone速度慢、访问不稳定等问题。这主要由于GitHub服务器位于海外,跨国网络传输存在物理延迟和带宽限制。根据实测数据,国内直连GitHub的下载速度通常只有20-50KB/s,而通过镜…

2026/10/8 7:03:10

电表的深谷电价是什么意思

大白话,就是电价白天贵、晚上便宜,按时间段分的更细,对电网和居民更友好。尖、峰、平、谷可能经常有听说,现在又多了个“深谷”,为什么又多了“深谷”:因为我国发电的方法越来越多,所以要更细分…

2026/10/8 7:03:10

Superpowers技能包:为Claude Code等AI编程助手构建可复用工作流

最初接触Superpowers,是在给Claude Code调工作流的时候。当时我总在重复做同一件事:每次让AI帮我改代码,光背景说明就要写一大堆,切换任务后它又把上一轮的约定忘得干干净净。后来才发现,问题不在AI笨,而是…

2026/10/8 7:03:10

扬州体育单招培训机构哪家强?选错耽误孩子一年!

引言对于江苏高三体育特长生而言,高职提前招生(体育单招)是升学的重要通道。然而,面对扬州市场上为数不多的体育单招培训机构,家长往往陷入选择困境:机构是否真正懂江苏高职提前招生的校测规则?…

2026/10/8 7:03:10

导师严选 AI论文写作软件 2026最新测评:好用工具推荐与对比

2026年真正好用的AI论文写作软件,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 …

2026/10/8 7:03:10

榨干端侧带宽:现代 C++ 推理引擎如何用就地计算玩转 DAG 拓扑?

在移动端与边缘嵌入式设备的深度学习推理工程中,物理内存带宽与峰值动态内存占用(Peak Memory Footprint)是制约模型端到端推理延迟与系统稳定性的关键瓶颈。对于非线性激活函数、通道偏置相加、数据归一化及数值截断等逐元素(Element-wise)变换算子,直接在输入张量的物理…

2026/10/8 6:58:10

一文搞懂 LangGraph 中间件执行时机

前言大家好!最近在深耕 LangGraph 智能体开发时,很多开发者都会用到中间件核心功能。但大部分人对中间件的执行时机、适用场景比较模糊,无法区分 Node 样式和 Wrap 样式的本质区别,也不清楚 before/after 系列钩子的具体使用场景。…

2026/10/5 6:32:56

Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化

1. 从“Jev”说起:为什么我要把Agent接进浏览器“Jev”这个词最近在圈子里出现的频率越来越高,很多人第一次听到会以为是某个新模型的名字,其实它更像是一种思路——把Jev模型的能力当作底座,通过Agent的方式去接管浏览器&#xf…

2026/10/7 8:18:33

多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系

1. 从"单兵作战"到"集群协同":多智能体编排到底在解决什么问题如果你最近在折腾 Agent 相关的东西,大概率会有一种感觉:单个 Agent 能做的事情,其实很快就摸到天花板了。你给它一个提示词,挂几个工…

2026/10/8 6:05:44

无源低通滤波器设计实战:从RC到LC,手把手教你避开那些坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 0:02:17

自然数立方等于连续奇数之和:从证明到编程验证

十几年来我一直游走在数学科普和编程教学这两块内容之间,对“看起来像魔法、拆开全是数学”的结论总是格外敏感。最近翻资料时又撞见一句话:任何一个自然数 m 的立方,都可以写成 m 个连续奇数之和。2 的立方等于 3 加 5,3 的立方等…

2026/10/8 0:02:17

C#上位机SSH连接实战:用SSH.NET补齐超时、批量与密钥认证

简介:这是一份基于 C# 开发的 SSH 连接功能半成品工程,原本作为另一个主项目的子功能模块,现独立打包分享。工程采用 WinForms 界面,包含源码、解决方案、安装部署工程、NuGet 依赖包及说明文档,适合正在做远程连接、网…

2026/10/8 0:02:17

Java SpringBoot一体化智能售后系统设计与实现全解析

毕业设计年年做,Java Web 方向的题目翻来覆去就那么几个,但“一体化智能售后系统”这个题,每次看到我都觉得值得认真聊一聊。它不是一个简单 curd 堆出来的管理系统,而是把客户、工单、派单、处理、回访、统计整条链路串起来的一套…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑