发布时间:2026/8/27 11:25:59
CANN ops-math split_v算子文档 aclnnSplitTensor【免费下载链接】ops-math本项目是CANN提供的数学类基础计算算子库实现网络在NPU上加速计算。项目地址: https://gitcode.com/cann/ops-math产品支持情况产品是否支持Ascend 950PR/Ascend 950DT×Atlas A3 训练系列产品/Atlas A3 推理系列产品×Atlas A2 训练系列产品/Atlas A2 推理系列产品√Atlas 200I/500 A2 推理产品×Atlas 推理系列产品×Atlas 训练系列产品×功能说明将输入self沿dim轴按照splitSections大小均匀切分。若dim轴无法被整除则非最后一块的大小等于splitSections最后一块小于splitSections。函数原型每个算子分为两段式接口必须先调用“aclnnSplitTensorGetWorkspaceSize”接口获取计算所需workspace大小以及包含了算子计算流程的执行器再调用“aclnnSplitTensor”接口执行计算。aclnnStatus aclnnSplitTensorGetWorkspaceSize( const aclTensor* self, uint64_t splitSections, int64_t dim, aclTensorList* out, uint64_t* workspaceSize, aclOpExecutor** executor)aclnnStatus aclnnSplitTensor( void* workspace, uint64_t workspaceSize, aclOpExecutor* executor, aclrtStream stream)aclnnSplitTensorGetWorkspaceSize参数说明参数名输入/输出描述使用说明数据类型数据格式维度shape非连续TensorselfaclTensor*输入表示被split的输入tensor-FLOAT、FLOAT16、DOUBLE、INT32、UINT32、INT64、UINT64、INT16、UINT16、INT8、UINT8、BOOL、COMPLEX128、COMPLEX64、BFLOAT16ND1-8√splitSectionsuint64_t输入表示沿dim轴均匀切分后的块大小, 最后一块可以小于splitSections。-UINT64---dimint64_t输入表示输入self被split的维度取值范围在[-self.dim(), self.dim())-INT64---outaclTensorList*输出表示被split后的输出tensor的列表。每个输出的dtype需要保持一致。TensorList中每个输出tensor的维度与self的维度一致。FLOAT、FLOAT16、DOUBLE、INT32、UINT32、INT64、UINT64、INT16、UINT16、INT8、UINT8、BOOL、COMPLEX128、COMPLEX64、BFLOAT16ND-√workspaceSizeuint64_t*输出返回需要在Device侧申请的workspace大小。-----executoraclOpExecutor**输出返回op执行器包含了算子计算流程。-----Atlas 推理系列产品 、 Atlas 训练系列产品 数据类型不支持BFLOAT16。返回值aclnnStatus返回状态码具体参见aclnn返回码。第一段接口完成入参校验出现以下场景时报错返回值错误码描述ACLNN_ERR_PARAM_NULLPTR161001传入的self、out是空指针。ACLNN_ERR_PARAM_INVALID161002self和out的数据类型不在支持的范围之内。self的长度不在支持的范围之内。out中的tensor长度不在支持的范围之内。dim的取值越界。被split的维度shape为0且splitSections不为0。被split的维度shape不为0且splitSections为0。aclnnSplitTensor参数说明参数名输入/输出描述workspace输入在Device侧申请的workspace内存地址。workspaceSize输入在Device侧申请的workspace大小由第一段接口aclnnSplitTensorGetWorkspaceSize获取。executor输入op执行器包含了算子计算流程。stream输入指定执行任务的Stream。返回值aclnnStatus返回状态码具体参见aclnn返回码。约束说明确定性计算aclnnSplitTensor默认确定性实现。调用示例示例代码如下仅供参考具体编译和执行过程请参考编译与运行样例。#include chrono #include algorithm #include iostream #include vector #include acl/acl.h #include aclnnop/aclnn_split_tensor.h #define CHECK_RET(cond, return_expr) \ do { \ if (!(cond)) { \ return_expr; \ } \ } while (0) #define LOG_PRINT(message, ...) \ do { \ printf(message, ##__VA_ARGS__); \ } while (0) int64_t GetShapeSize(const std::vectorint64_t shape) { int64_t shapeSize 1; for (auto i : shape) { shapeSize * i; } return shapeSize; } int Init(int32_t deviceId, aclrtStream* stream) { // 固定写法资源初始化 auto ret aclInit(nullptr); CHECK_RET(ret ACL_SUCCESS, LOG_PRINT(aclInit failed. ERROR: %d\n, ret); return ret); ret aclrtSetDevice(deviceId); CHECK_RET(ret ACL_SUCCESS, LOG_PRINT(aclrtSetDevice failed. ERROR: %d\n, ret); return ret); ret aclrtCreateStream(stream); CHECK_RET(ret ACL_SUCCESS, LOG_PRINT(aclrtCreateStream failed. ERROR: %d\n, ret); return ret); return 0; } template typename T int CreateAclTensor(const std::vectorT hostData, const std::vectorint64_t shape, void** deviceAddr, aclDataType dataType, aclTensor** tensor) { auto size GetShapeSize(shape) * sizeof(T); // 调用aclrtMalloc申请device侧内存 auto ret aclrtMalloc(deviceAddr, size, ACL_MEM_MALLOC_HUGE_FIRST); CHECK_RET(ret ACL_SUCCESS, LOG_PRINT(aclrtMalloc failed. ERROR: %d\n, ret); return ret); // 调用aclrtMemcpy将host侧数据拷贝到device侧内存上 ret aclrtMemcpy(*deviceAddr, size, hostData.data(), size, ACL_MEMCPY_HOST_TO_DEVICE); CHECK_RET(ret ACL_SUCCESS, LOG_PRINT(aclrtMemcpy failed. ERROR: %d\n, ret); return ret); // 计算连续tensor的strides std::vectorint64_t strides(shape.size(), 1); for (int64_t i shape.size() - 2; i 0; i--) { strides[i] shape[i 1] * strides[i 1]; } // 调用aclCreateTensor接口创建aclTensor *tensor aclCreateTensor(shape.data(), shape.size(), dataType, strides.data(), 0, aclFormat::ACL_FORMAT_ND, shape.data(), shape.size(), *deviceAddr); return 0; } void CheckResult(const std::vectorstd::vectorint64_t shapeList, const std::vectorvoid * addrList) { for (size_t i 0; i shapeList.size(); i) { auto size GetShapeSize(shapeList[i]); std::vectorfloat resultData(size, 0); auto ret aclrtMemcpy(resultData.data(), resultData.size() * sizeof(resultData[0]), addrList[i], size * sizeof(resultData[0]), ACL_MEMCPY_DEVICE_TO_HOST); CHECK_RET(ret ACL_SUCCESS, LOG_PRINT(aclrtMemcpy failed. ERROR: %d\n, ret); return); for (int64_t j 0; j size; j) { LOG_PRINT(result[%ld] is: %f\n, j, resultData[j]); } } } int main() { // 1.固定写法device/stream初始化参考acl API手册 // 根据自己的实际device填写deviceId int32_t deviceId 0; aclrtStream stream; auto ret Init(deviceId, stream); CHECK_RET(ret ACL_SUCCESS, LOG_PRINT(Init acl failed. ERROR: %d\n, ret); return ret); // 2. 构造输入与输出需要根据API的接口自定义构造 std::vectorint64_t selfShape {4, 2}; std::vectorint64_t shape1 {2, 2}; std::vectorint64_t shape2 {2, 2}; uint64_t splitSections 2; int64_t dim 0; void* selfDeviceAddr nullptr; void* shape1DeviceAddr nullptr; void* shape2DeviceAddr nullptr; aclTensor* self nullptr; aclTensor* shape1Addr nullptr; aclTensor* shape2Addr nullptr; std::vectorfloat selfHostData {0, 1, 2, 3, 4, 5, 6, 7}; std::vectorfloat shape1HostData {0, 1, 4, 5}; std::vectorfloat shape2HostData {2, 3, 6, 7}; // 创建self aclTensor ret CreateAclTensor(selfHostData, selfShape, selfDeviceAddr, aclDataType::ACL_FLOAT, self); CHECK_RET(ret ACL_SUCCESS, return ret); ret CreateAclTensor(shape1HostData, shape1, shape1DeviceAddr, aclDataType::ACL_FLOAT, shape1Addr); CHECK_RET(ret ACL_SUCCESS, return ret); ret CreateAclTensor(shape2HostData, shape2, shape2DeviceAddr, aclDataType::ACL_FLOAT, shape2Addr); CHECK_RET(ret ACL_SUCCESS, return ret); // 创建out aclTensorList std::vectoraclTensor* tmp {shape1Addr, shape2Addr}; aclTensorList* out aclCreateTensorList(tmp.data(), tmp.size()); CHECK_RET(out ! nullptr, return ret); // 调用CANN算子库API需要修改为具体的Api名称 uint64_t workspaceSize 0; aclOpExecutor *executor; // 调用aclnnSplitTensor第一段接口 ret aclnnSplitTensorGetWorkspaceSize(self, splitSections, dim, out, workspaceSize, executor); CHECK_RET(ret ACL_SUCCESS, LOG_PRINT(aclnnSplitTensorGetWorkspaceSize failed. ERROR: %d\n, ret); return ret); // 根据第一段接口计算出的workspaceSize申请device内存 void *workspaceAddr nullptr; if (workspaceSize 0) { auto ret aclrtMalloc(workspaceAddr, workspaceSize, ACL_MEM_MALLOC_HUGE_FIRST); CHECK_RET(ret ACL_SUCCESS, LOG_PRINT(allocate workspace failed. ERROR: %d\n, ret); return ret); } // 调用aclnnSplitTensor第二段接口 ret aclnnSplitTensor(workspaceAddr, workspaceSize, executor, stream); CHECK_RET(ret ACL_SUCCESS, LOG_PRINT(aclnnSplitTensor failed. ERROR: %d\n, ret); return ret); ret aclrtSynchronizeStream(stream); CheckResult({shape1, shape2}, {shape1DeviceAddr, shape2DeviceAddr}); // 6. 释放aclTensor和aclScalar需要根据具体API的接口定义修改 aclDestroyTensor(self); aclDestroyTensorList(out); aclDestroyTensor(shape1Addr); aclDestroyTensor(shape2Addr); // 7. 释放device 资源 aclrtFree(selfDeviceAddr); aclrtFree(shape1DeviceAddr); aclrtFree(shape2DeviceAddr); if (workspaceSize 0) { aclrtFree(workspaceAddr); } aclrtDestroyStream(stream); aclrtResetDevice(deviceId); aclFinalize(); return 0; }【免费下载链接】ops-math本项目是CANN提供的数学类基础计算算子库实现网络在NPU上加速计算。项目地址: https://gitcode.com/cann/ops-math创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/8/26 7:55:14

数字电路中的上拉与下拉电阻应用指南

1. 信号上拉与下拉的基础概念在数字电路设计中,上拉(Pull-up)和下拉(Pull-down)是两种常见的信号处理技术。它们通过电阻将信号线连接到电源(VCC)或地(GND),确…

2026/8/27 9:18:40

Kimi-K2.6-MXFP4量化配置详解:per-group量化与动态激活量化

Kimi-K2.6-MXFP4量化配置详解:per-group量化与动态激活量化 【免费下载链接】Kimi-K2.6-MXFP4 项目地址: https://ai.gitcode.com/hf_mirrors/amd/Kimi-K2.6-MXFP4 Kimi-K2.6-MXFP4是一个基于AMD-Quark优化工具进行MXFP4量化的先进多模态大语言模型。这个模…

2026/8/27 11:22:27

数学建模竞赛72小时实战指南:从团队协作到论文写作的完整策略

1. 赛前准备:不只是数学,更是策略与协作 全国大学生数学建模竞赛,这个名字听起来就充满了挑战和学术气息。但如果你以为这只是几个数学好的同学聚在一起解几道难题,那就大错特错了。从我带队的经验来看,这更像是一场为…

2026/8/27 11:22:27

C++模板编程:从泛型思想到STL实战,告别重复代码

1. 从“重复造轮子”到“一键生成”:为什么我们需要C模板? 如果你写过一段时间的C,尤其是写过一些需要处理多种数据类型的通用功能时,大概率会经历过这种痛苦:你需要一个函数来比较两个整数的大小,于是你写…

2026/8/27 11:22:27

开源BLE Beacon实战:从零搭建自己的信标系统

开源BLE Beacon实战笔记:从零搭一套属于自己的信标系统 做物联网这几年,Bluetooth Low Energy(BLE)和Beacon这两个词没少打交道。但说实话,市面上能买到的成品信标,要么封闭得要命、要么价格虚高&#xff…

2026/8/27 11:22:27

美赛建模实战手册:96小时工程化建模能力训练指南

1. 这不是“资料包”,而是一套可复用的建模作战手册 你搜到的标题里写着“2024美国大学生数学建模竞赛资料(完整版附下载地址)”,但现实中根本不存在真正意义上的“完整版”——因为MCM/ICM从来就不是靠背资料赢的。我带过7届校队…

2026/8/27 11:22:27

AHP与BP神经网络混合模型在书籍推荐中的实战应用

1. 项目背景与核心问题拆解最近在整理数学建模竞赛的实战案例,翻到了第四届Mathorcup(妈妈杯)的B题,题目是关于书籍推荐的。这个题目很有意思,它没有直接让你去调用现成的推荐算法库,而是要求你从零开始&am…

2026/8/27 11:17:21

LLM 与世界模型:从“会说话“到“会理解世界“-Day27

2024 年,大语言模型(LLM)让 AI 学会了写作、编程和对话。2026 年,Yann LeCun 离开 Meta,融资 10.3 亿美元创立 AMI Labs,宣称"LLM 将在 3-5 年内过时"。一、两个世界的分野:LLM 与世界…

2026/8/26 9:13:28

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/27 10:58:22

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/27 7:46:21

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/27 0:01:16

Go语言构建企业级AI服务网关:统一管理英伟达等AI接口调用

1. 项目概述:从零构建一个企业级的AI服务网关 最近在帮一个做内容审核的团队做技术架构升级,他们原来的业务里,每天有几十万张图片和短视频需要过审,最初是接了几个开源的AI模型自己部署,但效果和性能一直不太稳定。后…

2026/8/27 0:01:16

LeetCode Hot100(51-60)算法精解与面试技巧

1. 题目背景与核心价值"hot100(51-60)"这个标题看起来像是某个编程题库或算法练习集中的一组题目编号。在技术社区中,类似命名通常指向LeetCode、牛客网等平台的热门题目集合。作为刷过300题的算法老手,我理解这类题目的核心价值在于&#xff…

2026/8/27 0:01:16

CRC校验实战:从模2除法到HJ212协议排错

1. 为什么一个“校验码”能扛住工业现场90%的数据 corruption? 你有没有遇到过这样的场景:嵌入式设备通过RS-485上传温湿度数据,上位机偶尔收到一帧乱码——温度显示成-273℃,湿度跳到999%,但串口波形看起来完全正常&a…

2026/8/26 19:34:06

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/26 19:17:08

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/26 19:34:05

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…