CANN ops-nn Tanh梯度算子

发布时间:2026/9/14 0:26:23

CANN ops-nn Tanh梯度算子 aclnnTanhGrad【免费下载链接】ops-nn本项目是CANN提供的神经网络类计算算子库实现网络在NPU上加速计算。项目地址: https://gitcode.com/cann/ops-nn产品支持情况产品是否支持Atlas A2 训练系列产品/Atlas 800I A2 推理产品√功能说明算子功能完成 Tanh 的反向。计算公式$$ dx dy * (1 - y * y) $$函数原型每个算子分为两段式接口必须先调用aclnnTanhGradGetWorkspaceSize接口获取入参并根据计算流程计算所需workspace大小再调用aclnnTanhGrad接口执行计算。aclnnStatus aclnnTanhGradGetWorkspaceSize( const aclTensor *y, const aclTensor *dy, aclTensor *dx, uint64_t *workspaceSize, aclOpExecutor **executor)aclnnStatus aclnnTanhGrad( void *workspace, uint64_t workspaceSize, aclOpExecutor *executor, const aclrtStream stream)aclnnTanhGradGetWorkspaceSize参数说明参数名输入/输出描述使用说明数据类型数据格式维度(shape)非连续Tensory输入公式中的 yTanh 前向输出。dtype 需与 dy 保持一致。shape 需与 dy 相同。FLOAT、FLOAT16、BFLOAT16ND0-8√dy输入公式中的 dy上游梯度。数据类型与 y 的数据类型满足互推导关系。FLOAT、FLOAT16、BFLOAT16ND0-8√dx输出公式中的 dx输入梯度。dtype 需与 y 相同。shape 需与 y 相等。FLOAT、FLOAT16、BFLOAT16ND0-8√workspaceSize输出返回需要在 Device 侧申请的 workspace 大小。-----executor输出返回 op 执行器包含了算子计算流程。-----返回值aclnnStatus返回状态码具体参见aclnn返回码。 第一段接口会完成入参校验出现以下场景时报错返回码错误码描述ACLNN_ERR_PARAM_NULLPTR161001传入的 y 或 dy 是空指针。ACLNN_ERR_PARAM_INVALID161002y 或 dy 的数据类型不在支持的范围之内。y 或 dy 的 shape 超过 8 维。y、dy 与 dx 数据类型不一致。y 与 dy 的 shape 不一致。aclnnTanhGrad参数说明参数名输入/输出描述workspace输入在 Device 侧申请的 workspace 内存地址。workspaceSize输入在 Device 侧申请的 workspace 大小由第一段接口 aclnnTanhGradGetWorkspaceSize 获取。executor输入op 执行器包含了算子计算流程。stream输入指定执行任务的 Stream。返回值aclnnStatus返回状态码具体参见aclnn返回码。约束说明无。调用示例示例代码如下仅供参考具体编译和执行过程请参考编译与运行样例。#include iostream #include vector #include acl/acl.h #include aclnn_tanh_grad.h #define CHECK_RET(cond, return_expr) \ do { \ if (!(cond)) { \ return_expr; \ } \ } while (0) #define LOG_PRINT(message, ...) \ do { \ printf(message, ##__VA_ARGS__); \ } while (0) int64_t GetShapeSize(const std::vectorint64_t shape) { int64_t shapeSize 1; for (auto i : shape) { shapeSize * i; } return shapeSize; } int Init(int32_t deviceId, aclrtStream* stream) { auto ret aclInit(nullptr); CHECK_RET(ret ACL_SUCCESS, LOG_PRINT(aclInit failed. ERROR: %d\n, ret); return ret); ret aclrtSetDevice(deviceId); CHECK_RET(ret ACL_SUCCESS, LOG_PRINT(aclrtSetDevice failed. ERROR: %d\n, ret); return ret); ret aclrtCreateStream(stream); CHECK_RET(ret ACL_SUCCESS, LOG_PRINT(aclrtCreateStream failed. ERROR: %d\n, ret); return ret); return 0; } template typename T int CreateAclTensor(const std::vectorT hostData, const std::vectorint64_t shape, void** deviceAddr, aclDataType dataType, aclTensor** tensor) { auto size GetShapeSize(shape) * sizeof(T); auto ret aclrtMalloc(deviceAddr, size, ACL_MEM_MALLOC_HUGE_FIRST); CHECK_RET(ret ACL_SUCCESS, LOG_PRINT(aclrtMalloc failed. ERROR: %d\n, ret); return ret); ret aclrtMemcpy(*deviceAddr, size, hostData.data(), size, ACL_MEMCPY_HOST_TO_DEVICE); CHECK_RET(ret ACL_SUCCESS, LOG_PRINT(aclrtMemcpy failed. ERROR: %d\n, ret); return ret); std::vectorint64_t strides(shape.size(), 1); for (int64_t i shape.size() - 2; i 0; i--) { strides[i] shape[i 1] * strides[i 1]; } *tensor aclCreateTensor(shape.data(), shape.size(), dataType, strides.data(), 0, aclFormat::ACL_FORMAT_ND, shape.data(), shape.size(), *deviceAddr); return 0; } int main() { int32_t deviceId 0; aclrtStream stream; auto ret Init(deviceId, stream); CHECK_RET(ret ACL_SUCCESS, LOG_PRINT(Init acl failed. ERROR: %d\n, ret); return ret); std::vectorint64_t yShape {2, 2}; std::vectorint64_t dyShape {2, 2}; std::vectorint64_t dxShape {2, 2}; void* yDeviceAddr nullptr; void* dyDeviceAddr nullptr; void* dxDeviceAddr nullptr; aclTensor* y nullptr; aclTensor* dy nullptr; aclTensor* dx nullptr; // y tanh(x), example values after tanh std::vectorfloat yHostData {0.7616, 0.9640, 0.9951, 0.9993}; std::vectorfloat dyHostData {4.5, 4.4, 4.3, 4.2}; std::vectorfloat dxHostData {0.0, 0.0, 0.0, 0.0}; ret CreateAclTensor(yHostData, yShape, yDeviceAddr, aclDataType::ACL_FLOAT, y); CHECK_RET(ret ACL_SUCCESS, return ret); ret CreateAclTensor(dyHostData, dyShape, dyDeviceAddr, aclDataType::ACL_FLOAT, dy); CHECK_RET(ret ACL_SUCCESS, return ret); ret CreateAclTensor(dxHostData, dxShape, dxDeviceAddr, aclDataType::ACL_FLOAT, dx); CHECK_RET(ret ACL_SUCCESS, return ret); uint64_t workspaceSize 0; aclOpExecutor* executor; ret aclnnTanhGradGetWorkspaceSize(y, dy, dx, workspaceSize, executor); CHECK_RET(ret ACL_SUCCESS, LOG_PRINT(aclnnTanhGradGetWorkspaceSize failed. ERROR: %d\n, ret); return ret); void* workspaceAddr nullptr; if (workspaceSize 0) { ret aclrtMalloc(workspaceAddr, workspaceSize, ACL_MEM_MALLOC_HUGE_FIRST); CHECK_RET(ret ACL_SUCCESS, LOG_PRINT(allocate workspace failed. ERROR: %d\n, ret); return ret); } ret aclnnTanhGrad(workspaceAddr, workspaceSize, executor, stream); CHECK_RET(ret ACL_SUCCESS, LOG_PRINT(aclnnTanhGrad failed. ERROR: %d\n, ret); return ret); ret aclrtSynchronizeStream(stream); CHECK_RET(ret ACL_SUCCESS, LOG_PRINT(aclrtSynchronizeStream failed. ERROR: %d\n, ret); return ret); auto size GetShapeSize(dxShape); std::vectorfloat resultData(size, 0); ret aclrtMemcpy(resultData.data(), resultData.size() * sizeof(resultData[0]), dxDeviceAddr, size * sizeof(resultData[0]), ACL_MEMCPY_DEVICE_TO_HOST); CHECK_RET(ret ACL_SUCCESS, LOG_PRINT(copy result failed. ERROR: %d\n, ret); return ret); for (int64_t i 0; i size; i) { LOG_PRINT(result[%ld] is: %f\n, i, resultData[i]); } aclDestroyTensor(y); aclDestroyTensor(dy); aclDestroyTensor(dx); aclrtFree(yDeviceAddr); aclrtFree(dyDeviceAddr); aclrtFree(dxDeviceAddr); if (workspaceSize 0) { aclrtFree(workspaceAddr); } aclrtDestroyStream(stream); aclrtResetDevice(deviceId); aclFinalize(); return 0; }【免费下载链接】ops-nn本项目是CANN提供的神经网络类计算算子库实现网络在NPU上加速计算。项目地址: https://gitcode.com/cann/ops-nn创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/9/11 11:26:27

Pyecharts地图实战篇 - 从数据准备到交互式热力图生成的完整指南

1. Pyecharts地图可视化入门指南第一次接触Pyecharts地图可视化时,我被它的简单高效震惊了。作为一个常年和Excel打交道的分析师,以前要做一个省级销售热力图,至少得折腾半天。现在用Pyecharts,十几行代码就能生成交互式地图&…

2026/9/11 23:37:51

C++职责链模式实战:从设计原理到日志框架应用

1. 项目概述:为什么我们需要职责链模式? 在C项目里,尤其是处理那些流程化、多分支的业务逻辑时,我们经常会遇到一种头疼的情况:一个请求(比如一个用户操作、一个事件、一个数据包)需要经过一系列…

2026/9/14 0:23:24

python代码性能优化

1.可视化逐行代码运行时间工具vprof:安装:sudo pip3 vprof然后直接用它运行代码:vprof -c h test.pyh会让它根据每行代码的运行时间附上热图。需要带输入时:vprof -c cmh "testscript.py --foo --bar"2.强烈推荐&#x…

2026/9/14 0:23:24

基于Python的招聘数据分析以及可视化-计算机毕业设计源码+LW文档

1课题背景及研究意义1.1课题背景自从互联网技术迅猛发展, 以及数字经济时期光临后, 通过网络进行的招聘已然变成企业跟求职者相互间的主要交流途径。像是智联招聘、BOSS直聘等占据主导地位有着众多求职者及招聘方使用的就业找工作选取人员任用筛选的网页平台每天都会产生数量无…

2026/9/14 0:23:24

为什么5和“5“不一样?十分钟搞懂Python变量与数据类型

你步入一家便利店, 跟店员讲, “我要5瓶水”, 又讲, “我要‘5’瓶水”, 对方均可领会。然而要是你针对说5加上1, 它给出的回应是6;你讲"5"再加上1, 它马上就会出现报错情况。这并非是在耍小孩子般的脾气, 而是鉴于5和“5”属于两种全然不一样的“事物”,…

2026/9/14 0:23:24

Python性能优化

1. 使用内建函数: 你能够运用写出具备高效特性的代码, 然而却不容易战胜那内置有的函数, 经细致查证之后, 它们是极为迅速的。 2.使用join()连接字符串. 你能够运用“”去连接字符串, 然而鉴于在其中是不可变的情形, 每一回“”操作都会生成一个全新的字符串, 并且复制旧有的…

2026/9/14 0:23:24

基于springboot支部智慧党建综合信息分析及可视化系统【spring】

摘要: 信息技术飞速发展着, 智慧党建成了提升党组织管理效率以及党员服务水平的重要手段。本文设计兼实现了一个基于的支部智慧党建综合信息分析与可视化系统, 目的在于借由信息化手段, 达成党员信息的集中管理、数据分析还有可视化展示, 提升党建工作的智能化水平。系统采用框…

2026/9/13 0:01:16

拯救者Y7000黑屏故障排查与维修实战指南

1. 项目概述:一台黑屏的拯救者Y7000,到底卡在哪一步? 联想拯救者Y7000系列笔记本,从2018年第一代搭载i5-8300H开始,到后来的i7-9750H、i7-10750H、i5-11400H,再到2023年款的R7-7840HS,它始终是学…

2026/9/14 0:03:22

KCF目标跟踪算法与OTB工程实现:毕业设计实战解析

简介:这是一份基于KCF核相关滤波算法、融合尺度池与抗遮挡处理的目标检测跟踪MATLAB完整源码,主要面向计算机相关专业准备毕业设计、课程设计或期末大作业的学生,也适合需要项目实战练习的初学者。源码在OTB数据集上完成验证,能够…

2026/9/14 0:03:22

语音情感识别实战:Keras实现LSTM、CNN、SVM与MLP多模型对比

简介:面向语音情感识别入门与进阶开发者,这份基于Keras的项目源码完整实现了LSTM、CNN、SVM、MLP四种模型,兼容Python3.8与Keras/TensorFlow2环境。压缩包内含49个文件,大小约70.31MB,主体包括Python脚本、yaml/json配…

2026/9/12 6:29:36

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/12 14:32:17

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/13 11:18:28

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码