昇腾C GM与L1或L0数据搬运

发布时间:2026/9/10 7:22:07

昇腾C GM与L1或L0数据搬运 GM与L1或L0数据搬运【免费下载链接】asc-devkit本项目是CANN 推出的昇腾AI处理器专用的算子程序开发语言原生支持C和C标准规范主要由类库和语言扩展层构成提供多层级API满足多维场景算子开发诉求。项目地址: https://gitcode.com/cann/asc-devkit总体说明Global Memory与L1 Buffer/L0 Buffer之间的数据搬运提供了灵活、分层的接口支持能够充分适配多样化的计算场景见表1。其中Global Memory与L1 Buffer、Global Memory-L0A Buffer、Global Memory-L0B Buffer的数据搬运用于矩阵计算参考矩阵计算的搬入L0C Buffer-Global Memory用于将矩阵计算结果搬出完成矩阵计算的输出流程参考矩阵计算的搬出。开发者能够通过灵活配置结构体参数精确控制数据块数量、数据块长度及地址间隔等关键属性实现高维切分数据搬运充分释放硬件的数据搬运与计算协同能力显著提升算子的执行效率与整体性能。表 1Global Memory与L1 Buffer/L0 Buffer数据搬运接口概述数据通路功能描述Global Memory与L1 Buffer连续数据搬运(DataCopy)提供基础的数据搬运能力数据在传输过程中保持原始格式和内容不变支持连续数据搬运。Global Memory与L1 Buffer高维切分数据搬运(DataCopy)提供基础的数据搬运能力数据在传输过程中保持原始格式和内容不变支持连续和非连续的数据搬运。Global Memory-L1 Buffer随路转换-ND2NZ搬运(DataCopy)支持在数据搬运时进行ND到NZ格式的转换。Global Memory-L1 Buffer随路转换-DN2NZ搬运(DataCopy)支持在数据搬运时进行DN到NZ格式的转换。Global Memory-L1 Buffer非对齐数据搬运(DataCopyPad)支持数据非对齐搬运可以根据开发者的需要自行填充数据。Global Memory-L1 BufferNZ数据搬运(LoadData2D矩阵搬运)负责完成NZ矩阵的数据搬运。Global Memory-L1 BufferNZ数据搬运(LoadData2D矩阵搬运V2)负责完成NZ矩阵的数据搬运。Global Memory-L0A Buffer2D格式分形矩阵搬运(LoadData2D矩阵搬运)负责完成普通矩阵计算所需的2D格式数据的搬运。Global Memory-L0B Buffer2D格式分形矩阵搬运(LoadData2D矩阵搬运)负责完成普通矩阵计算所需的2D格式数据的搬运。L0C Buffer-Global Memory随路量化激活搬运(DataCopy)支持多种随路能力的组合需要设置不同的寄存器配合DataCopy接口使能不同的数据搬运能力。L0C Buffer-Global Memory随路量化激活搬运(FixPipe)支持多种随路能力的组合FixPipe接口内包含了设置寄存器与数据搬运能力。GM与L1连续数据搬运(DataCopy)DataCopy能够实现Global Memory和L1 Buffer之间的连续数据搬运数据搬运时格式和内容保持不变。具体支持的数据通路为以逻辑位置TPosition表示Global Memory - L1 BufferGM - A1/B1L1 Buffer - Global MemoryA1/B1 - GM搬运的数据用于矩阵计算接口具体介绍请参考GMToL1连续数据搬运DataCopy。src和dst分别为源操作数和目的操作数count为连续搬运的元素个数。Global Memory - L1 Buffertemplate typename T __aicore__ inline void DataCopy(const LocalTensorT dst, const GlobalTensorT src, const uint32_t count)L1 Buffer - Global Memorytemplate typename T __aicore__ inline void DataCopy(const GlobalTensorT dst, const LocalTensorT src, const uint32_t count)GM与L1高维切分数据搬运(DataCopy)DataCopy能够实现Global Memory和L1 Buffer之间的连续数据搬运和非连续数据搬运数据搬运时格式和内容保持不变。高维切分是指能够通过配置数据块个数、单个数据块长度、地址偏移等搬运参数实现非连续搬运。具体支持的数据通路为以逻辑位置TPosition表示Global Memory - L1 BufferGM - A1/B1L1 Buffer - Global MemoryA1/B1 - GM搬运的数据用于矩阵计算接口具体介绍请参考GMToL1高维切分数据搬运DataCopy。src和dst分别为源操作数和目的操作数repeatParams为搬运参数。Global Memory - L1 Buffertemplate typename T __aicore__ inline void DataCopy(const LocalTensorT dst, const GlobalTensorT src, const DataCopyParams repeatParams)L1 Buffer - Global Memorytemplate typename T __aicore__ inline void DataCopy(const GlobalTensorT dst, const LocalTensorT src, const DataCopyParams repeatParams)GMToL1随路转换-ND2NZ搬运(DataCopy)该接口主要实现将数据从Global Memory搬运至L1 Buffer并支持在数据搬运时进行ND到NZ格式的转换。具体支持的数据通路为以逻辑位置TPosition表示Global Memory - L1 BufferGM - A1/B1搬运的数据用于矩阵计算接口具体介绍请参考GMToL1随路转换-ND2NZ搬运DataCopy。src和dst分别为源操作数和目的操作数intriParams为ND2NZ搬运配置参数。不支持enableSmallC0模式template typename T __aicore__ inline void DataCopy(const LocalTensorT dst, const GlobalTensorT src, const Nd2NzParams intriParams)支持enableSmallC0模式仅Ascend 950PR/Ascend 950DT支持template typename T, bool enableSmallC0 false __aicore__ inline void DataCopy(const LocalTensorT dst, const GlobalTensorT src, const Nd2NzParams intriParams)GMToL1随路转换-DN2NZ搬运(DataCopy)该接口主要实现将数据从Global Memory搬运至L1 Buffer并支持在数据搬运时进行DN到NZ格式的转换。具体支持的数据通路为以逻辑位置TPosition表示Global Memory - L1 BufferGM - A1/B1搬运的数据用于矩阵计算接口具体介绍请参考GMToL1随路转换-DN2NZ搬运DataCopy。src和dst分别为源操作数和目的操作数intriParams为DN2NZ搬运配置参数。支持enableSmallC0模式仅Ascend 950PR/Ascend 950DT支持template typename T, bool enableSmallC0 false __aicore__ inline void DataCopy(const LocalTensorT dst, const GlobalTensorT src, const Dn2NzParams intriParams);GMToL1非对齐数据搬运(DataCopyPad)该接口主要实现将数据从Global Memory搬运至L1 Buffer并支持在数据搬运时提供非对齐数据搬运功能可以根据开发者的需要自行填充数据。具体支持的数据通路为以逻辑位置TPosition表示Global Memory - L1 BufferGM - A1/B1搬运的数据用于矩阵计算接口具体介绍请参考GMToL1非对齐数据搬运DataCopyPad。src和dst分别为源操作数和目的操作数dataCopyParams和padParams为搬运参数。仅Ascend 950PR/Ascend 950DT支持template typename T, PaddingMode mode PaddingMode::Normal __aicore__ inline void DataCopyPad(const LocalTensorT dst, const GlobalTensorT src, const DataCopyExtParams dataCopyParams, const DataCopyPadExtParamsT padParams)GMToL1 NZ数据搬运(LoadData2D矩阵搬运)该接口主要实现将数据从Global Memory搬运至L1 Buffer负责完成普通矩阵计算所需的2D格式数据的搬运以大小为512Byte的数据分形为单位进行搬运。具体支持的数据通路为以逻辑位置TPosition表示Global Memory - L1 BufferGM - A1/B1搬运的数据用于矩阵计算接口具体介绍请参考GMToL1-2D矩阵搬运LoadData。src和dst分别为源操作数和目的操作数loadDataParams为搬运参数。template typename T __aicore__ inline void LoadData(const LocalTensorT dst, const GlobalTensorT src, const LoadData2DParams loadDataParams)GMToL1 NZ数据搬运(LoadData2D矩阵搬运V2)该接口主要实现将数据从Global Memory搬运至L1 Buffer负责完成普通矩阵计算所需的2D格式数据的搬运以大小为512Byte的数据分形为单位进行搬运。具体支持的数据通路为以逻辑位置TPosition表示Global Memory - L1 BufferGM - A1/B1搬运的数据用于矩阵计算接口具体介绍请参考GMToL1-2D矩阵搬运V2LoadData。src和dst分别为源操作数和目的操作数loadDataParams为搬运参数。仅Ascend 950PR/Ascend 950DT支持template typename T __aicore__ inline void LoadData(const LocalTensorT dst, const GlobalTensorT src, const LoadData2DParamsV2 loadDataParams)GMToL0A 2D格式分形矩阵搬运(LoadData2D矩阵搬运)该接口主要实现将数据从Global Memory搬运至L0A Buffer负责完成普通矩阵计算所需的2D格式数据的搬运以大小为512Byte的数据分形为单位进行搬运。具体支持的数据通路为以逻辑位置TPosition表示Global Memory - L0A BufferGM - A2搬运的数据用于矩阵计算接口具体介绍请参考LoadData2D矩阵搬运。src和dst分别为源操作数和目的操作数loadDataParams为搬运参数。template typename T __aicore__ inline void LoadData(const LocalTensorT dst, const GlobalTensorT src, const LoadData2DParams loadDataParams)GMToL0B 2D格式分形矩阵搬运(LoadData2D矩阵搬运)该接口主要实现将数据从Global Memory搬运至L0B Buffer负责完成普通矩阵计算所需的2D格式数据的搬运以大小为512Byte的数据分形为单位进行搬运。具体支持的数据通路为以逻辑位置TPosition表示Global Memory - L0B BufferGM - B2搬运的数据用于矩阵计算接口具体介绍请参考LoadData2D矩阵搬运。src和dst分别为源操作数和目的操作数loadDataParams为搬运参数。template typename T __aicore__ inline void LoadData(const LocalTensorT dst, const GlobalTensorT src, const LoadData2DParams loadDataParams)L0CToGM随路量化激活搬运(DataCopy)该接口主要实现将数据从L0C Buffer搬运至Global Memory并支持多种随路能力的组合需要设置不同的寄存器。具体支持的数据通路为以逻辑位置TPosition表示L0C Buffer - Global MemoryCO1 - GM搬运的数据为矩阵计算的结果接口具体介绍请参考L0C到GM数据搬运DataCopy。src和dst分别为源操作数和目的操作数intriParams为搬运参数。template typename T, typename U __aicore__ inline void DataCopy(const GlobalTensorT dst, const LocalTensorU src, const DataCopyCO12DstParams intriParams)L0CToGM随路量化激活搬运(FixPipe)该接口主要实现将数据从L0C Buffer搬运至Global Memory并支持多种随路能力的组合接口内包含了设置寄存器与数据搬运能力。具体支持的数据通路为以逻辑位置TPosition表示L0C Buffer - Global MemoryCO1 - GM搬运的数据为矩阵计算的结果以Ascend 950PR/Ascend 950DT为例接口示例如下注意不同产品型号的接口原型可能不同具体介绍请参考L0C到GM数据搬运Fixpipe。src和dst分别为源操作数和目的操作数intriParams为搬运参数cbufWorkspace为开启tensor量化时所需的量化参数。不开启随路tensor量化功能template typename T, typename U, const FixpipeConfig config CFG_ROW_MAJOR __aicore__ inline void Fixpipe(const GlobalTensorT dst, const LocalTensorU src, const FixpipeParamsArch3510config.format intriParams)开启随路tensor量化功能template typename T, typename U, const FixpipeConfig config CFG_ROW_MAJOR __aicore__ inline void Fixpipe(const GlobalTensorT dst, const LocalTensorU src, const LocalTensoruint64_t cbufWorkspace, const FixpipeParamsArch3510config.format intriParams)【免费下载链接】asc-devkit本项目是CANN 推出的昇腾AI处理器专用的算子程序开发语言原生支持C和C标准规范主要由类库和语言扩展层构成提供多层级API满足多维场景算子开发诉求。项目地址: https://gitcode.com/cann/asc-devkit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/9/8 3:54:03

锐龙AI Max+ 395开启全能桌面AI主机“王炸”时刻

作者:毛烁下午的渲染任务跑到第三个小时,桌子底下那台全塔工作站的风扇又一次拉满了转速。几张独立显卡同时满载,机箱不断往外吐着热浪,整个试验室都被持续不断的风噪填满。每次它开始干活,大家说话都得提高音量&#…

2026/9/9 19:16:08

CANN/asc-devkit WaitPreTaskEnd任务间同步接口文档

WaitPreTaskEnd 【免费下载链接】asc-devkit 本项目是CANN 推出的昇腾AI处理器专用的算子程序开发语言,原生支持C和C标准规范,主要由类库和语言扩展层构成,提供多层级API,满足多维场景算子开发诉求。 项目地址: https://gitcode…

2026/9/11 7:10:34

马达控制板智能控制方案实战:从选型到调参的完整指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/11 7:10:34

三维设计软件采购避坑指南与成本优化策略

1. 项目背景:三维设计软件采购的典型痛点去年公司准备升级三维设计软件时,我们差点掉进一个价值20万的"天坑"。作为技术部门负责人,我完整经历了从选型评估到问题解决的全过程。现在把这段经历分享出来,希望能帮同行们避…

2026/9/11 7:10:34

IntelliJ IDEA插件实战指南:从必装清单到性能优化

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/11 7:10:34

六相PMSM矢量控制详解:从坐标变换、双dq电流环到容错控制

简介:面向电机控制学习者和工程师的六相永磁同步电机(PMSM)矢量控制仿真资源包,基于VSD坐标变换实现磁场定向控制,适用于理解六相电机解耦建模、双d-q轴电流调节及PWM调制策略。资源共2个文件,包含1个m脚本…

2026/9/11 7:05:33

MATLAB轴承故障信号模拟与时频分析技术详解

1. 项目概述:轴承故障信号模拟与分析的工程价值 作为一名在设备状态监测领域工作多年的工程师,我深知滚动轴承故障诊断的重要性。轴承作为旋转机械的核心部件,其健康状况直接影响设备运行安全。传统故障诊断依赖物理实验,成本高、…

2026/9/10 16:39:38

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/10 11:16:38

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/9 16:31:09

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/10 12:32:02

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/10 15:19:50

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/10 15:49:53

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码