发布时间:2026/7/24 22:20:02
吴恩达深度学习课程一:神经网络和深度学习 第四周:深度神经网络的关键概念 吴恩达深度学习课程一神经网络和深度学习 第四周深度神经网络的关键概念大家好我是你们的技术博主小深。今天我们来聊聊吴恩达老师的深度学习课程第一部分的第四周内容——深度神经网络的关键概念。如果你已经学完了前三周从线性回归到浅层神经网络那么第四周就是带你从“浅水区”游向“深水区”的关键一步。别怕我会用大白话讲清楚并配上可运行的代码示例让你看得懂、跑得动。## 什么是深度神经网络深度神经网络Deep Neural Network简称DNN说白了就是有很多层隐藏层的神经网络。浅层神经网络比如只有一个隐藏层能解决的问题有限比如简单的分类任务。但现实中很多问题比如图像识别、语音识别非常复杂需要多层神经网络来提取更抽象的特征。举个例子识别一张图片里有没有猫。浅层网络可能只能看到像素点边缘、颜色而深层网络可以逐步组合出“眼睛”、“耳朵”、“胡须”这些更高级的特征最后判断是不是猫。这就是“深层”的价值——层次越深特征越抽象。## 关键概念一前向传播和反向传播在深度神经网络中训练过程分为两步前向传播Forward Propagation和反向传播Backward Propagation。简单来说-前向传播从输入层开始一层一层向前计算直到输出层。每层会计算线性部分z w * a_prev b和激活部分a activation(z)。-反向传播从输出层开始向后计算每一层的梯度即损失函数对参数的导数然后用这些梯度更新参数。这两个过程是“对偶”的前向传播时的中间值比如z和a会被缓存下来供反向传播使用。这就是为什么代码里要“缓存”中间结果。下面是前向传播的通用公式- 对于第l层Z[l] W[l] * A[l-1] b[l]- A[l] gl其中g[l]是激活函数ReLU、sigmoid等反向传播的梯度计算公式以sigmoid为例- dZ[l] dA[l] * g[l](Z[l])- dW[l] (1/m) * dZ[l] * A[l-1]T- db[l] (1/m) * np.sum(dZ[l], axis1, keepdimsTrue)## 关键概念二参数初始化深度神经网络对参数初始化非常敏感。如果W初始化为0那么所有隐藏单元会对称导致所有神经元学到相同的东西即“对称性问题”。因此我们通常使用随机初始化并且根据激活函数选择不同的缩放因子。对于ReLU激活函数推荐使用“He初始化”W[l] np.random.randn(shape) * np.sqrt(2 / n[l-1])对于tanh或sigmoid推荐使用“Xavier初始化”W[l] np.random.randn(shape) * np.sqrt(1 / n[l-1])## 代码示例一实现深度神经网络的前向传播下面是一个简单的深度神经网络前向传播代码包含两层隐藏层使用ReLU和输出层使用sigmoid。注意看缓存机制。pythonimport numpy as npdef initialize_parameters(layer_dims): 初始化深度神经网络的参数 layer_dims: 包含每层神经元数量的列表例如 [2, 4, 3, 1] 表示输入层2个隐藏层1有4个隐藏层2有3个输出层1个 np.random.seed(1) # 固定随机种子方便复现 parameters {} L len(layer_dims) # 层数包括输入层 for l in range(1, L): # He初始化适用于ReLU parameters[W str(l)] np.random.randn(layer_dims[l], layer_dims[l-1]) * np.sqrt(2 / layer_dims[l-1]) parameters[b str(l)] np.zeros((layer_dims[l], 1)) return parametersdef linear_forward(A_prev, W, b): 线性前向传播Z W * A_prev b Z np.dot(W, A_prev) b cache (A_prev, W, b) # 缓存供反向传播使用 return Z, cachedef activation_forward(Z, activation_type): 激活函数前向传播 if activation_type sigmoid: A 1 / (1 np.exp(-Z)) cache Z elif activation_type relu: A np.maximum(0, Z) cache Z else: raise ValueError(Unsupported activation type) return A, cachedef forward_propagation(X, parameters): 完整的前向传播 caches [] A X L len(parameters) // 2 # 层数不包括输入层 # 隐藏层使用ReLU for l in range(1, L): A_prev A W parameters[W str(l)] b parameters[b str(l)] Z, linear_cache linear_forward(A_prev, W, b) A, activation_cache activation_forward(Z, relu) caches.append((linear_cache, activation_cache)) # 输出层使用sigmoid W parameters[W str(L)] b parameters[b str(L)] Z, linear_cache linear_forward(A, W, b) A, activation_cache activation_forward(Z, sigmoid) caches.append((linear_cache, activation_cache)) return A, caches# 测试输入层2个特征两个隐藏层4个和3个神经元输出层1个layer_dims [2, 4, 3, 1]parameters initialize_parameters(layer_dims)X np.array([[0.5, 0.2], [0.1, 0.8]]) # 两个样本A_final, caches forward_propagation(X, parameters)print(输出层结果, A_final)运行这段代码你会看到输出层的结果概率值它表示每个样本属于正类的概率。注意这里参数是随机初始化的所以结果不是训练后的预测。## 关键概念三为什么深度神经网络有效深度神经网络之所以强大有两个主要原因1.层次化特征提取浅层网络只能学习简单特征如边缘深层网络可以组合这些特征形成更复杂的模式。在图像识别中第一层学边缘第二层学形状第三层学物体部件第四层学整个物体。2.参数共享和效率深度神经网络通过分层结构可以用更少的参数模拟更复杂的函数。理论上一个足够深的网络可以用指数级少的参数达到与浅层网络相同的表示能力。## 关键概念四深度神经网络的训练技巧训练深度神经网络时有几个常见问题需要留意-梯度消失/爆炸当网络很深时梯度在反向传播中可能指数级缩小消失或增大爆炸。解决方法包括使用ReLU等非饱和激活函数、批量归一化、梯度裁剪。-过拟合深度网络参数多容易过拟合。可以用L2正则化、dropout、数据增强来缓解。-学习率调整深度网络训练需要合适的学习率。可以使用学习率衰减learning rate decay或自适应优化器如Adam。## 代码示例二实现深度神经网络的损失函数和反向传播下面我们实现一个完整的反向传播示例包括损失函数计算和梯度更新。pythondef compute_loss(A_final, Y): 计算交叉熵损失 A_final: 输出层激活值预测概率 Y: 真实标签0或1 m Y.shape[1] loss -1/m * np.sum(Y * np.log(A_final) (1 - Y) * np.log(1 - A_final)) return np.squeeze(loss)def linear_backward(dZ, cache): 线性反向传播计算dW, db, dA_prev A_prev, W, b cache m A_prev.shape[1] dW 1/m * np.dot(dZ, A_prev.T) db 1/m * np.sum(dZ, axis1, keepdimsTrue) dA_prev np.dot(W.T, dZ) return dA_prev, dW, dbdef activation_backward(dA, cache, activation_type): 激活函数反向传播计算dZ Z cache if activation_type sigmoid: s 1 / (1 np.exp(-Z)) dZ dA * s * (1 - s) # sigmoid导数 elif activation_type relu: dZ dA * (Z 0) # ReLU导数大于0时为1否则为0 else: raise ValueError(Unsupported activation type) return dZdef backward_propagation(Y, caches): 完整的反向传播返回所有参数的梯度 grads {} L len(caches) m Y.shape[1] # 初始化输出层的dAcross-entropy loss对sigmoid输出的导数 A_final, _ caches[-1] # caches中最后一组是输出层 dA - (np.divide(Y, A_final) - np.divide(1 - Y, 1 - A_final)) # 反向传播从输出层开始 for l in reversed(range(L)): linear_cache, activation_cache caches[l] if l L-1: # 输出层使用sigmoid dZ activation_backward(dA, activation_cache, sigmoid) else: # 隐藏层使用ReLU dZ activation_backward(dA, activation_cache, relu) dA_prev, dW, db linear_backward(dZ, linear_cache) grads[dW str(l1)] dW grads[db str(l1)] db dA dA_prev return gradsdef update_parameters(parameters, grads, learning_rate): 使用梯度下降更新参数 L len(parameters) // 2 for l in range(L): parameters[W str(l1)] - learning_rate * grads[dW str(l1)] parameters[b str(l1)] - learning_rate * grads[db str(l1)] return parameters# 测试反向传播使用上面的前向传播结果Y np.array([[1, 0]]) # 两个样本的真实标签loss compute_loss(A_final, Y)print(损失值, loss)grads backward_propagation(Y, caches)print(dW3的形状, grads[dW3].shape) # 输出层权重梯度# 更新参数parameters update_parameters(parameters, grads, learning_rate0.01)print(更新后的W3, parameters[W3][:2]) # 只看前两行运行这段代码你会看到损失值和梯度更新的结果。这就是深度神经网络训练的核心循环前向传播 - 计算损失 - 反向传播 - 更新参数。## 总结深度神经网络是深度学习的基础。第四周课程主要教会我们三件事1.深层网络的结构通过堆叠多个隐藏层网络可以学习更抽象的特征。2.前向传播和反向传播这是训练的核心需要理解每层的计算和缓存机制。3.参数初始化与训练技巧好的初始化能加速收敛梯度消失/爆炸需要警惕。从代码实现来看深度神经网络的代码虽然比浅层网络复杂但核心思想是一致的线性变换 激活函数然后反复堆叠。只要你掌握了浅层网络第三周内容深层网络只是“重复”和“缓存”的升级版。吴恩达老师在这周的课程中还强调了向量化实现的重要性——用矩阵运算替代for循环能让代码跑得飞快。上面我的代码例子已经用了向量化你可以试试跑一下感受一下矩阵运算的魅力。最后记住一句话深度不是魔法而是层次化抽象。希望这篇文章能帮你更好地理解深度神经网络如果你有任何疑问欢迎在评论区留言讨论。

相关新闻

2026/7/24 22:20:02

Bili2Text:一键将B站视频转为可编辑文字的终极解决方案

Bili2Text:一键将B站视频转为可编辑文字的终极解决方案 【免费下载链接】bili2text Bilibili视频转文字,一步到位,输入链接即可使用 项目地址: https://gitcode.com/gh_mirrors/bi/bili2text 在当今视频内容爆炸的时代,你是…

2026/7/24 23:50:08

AI学术写作助手:提升论文效率与质量的关键技术

1. 项目概述:当AI写作助手遇上学术论文去年指导表弟毕业论文时,我亲眼见证了一个拖延症晚期患者的"奇迹"——在答辩前72小时,他抱着台旧笔记本冲进我家,屏幕上开着十几个文献网页,Word文档里却只有孤零零的标…

2026/7/24 23:50:08

城通网盘直连解析技术架构与实现原理深度解析

城通网盘直连解析技术架构与实现原理深度解析 【免费下载链接】ctfileGet 获取城通网盘一次性直连地址 项目地址: https://gitcode.com/gh_mirrors/ct/ctfileGet ctfileGet是一个基于Web技术的城通网盘解析工具,采用本地化解析技术实现城通网盘分享链接到直连…

2026/7/24 23:50:08

LinkSwift网盘直链下载助手:九大网盘免费真实链接获取终极指南

LinkSwift网盘直链下载助手:九大网盘免费真实链接获取终极指南 【免费下载链接】Online-disk-direct-link-download-assistant 一个基于 JavaScript 的网盘文件下载地址获取工具。基于【网盘直链下载助手】修改 ,支持 百度网盘 / 阿里云盘 / 中国移动云盘…

2026/7/24 23:45:06

旧手机处理前的 2FA 绑定的清理清单

更换设备后,旧手机上仍可能保留着各平台 2FA 的绑定数据。若旧手机被闲置、转送或二手出给他人,持有者可能利用残留的 2FA 数据实时生成验证码,登录未解除绑定的账号。 以下清单按平台分类,列出常见的 2FA 解绑操作路径&#xff0…

2026/7/23 12:54:51

Unity与Python本地通信:基于Flask的跨语言数据交换实战

1. 项目概述:为什么我们需要一个本地通信服务器?在游戏开发、数字孪生、仿真训练等众多领域,Unity作为强大的实时3D内容创作平台,其核心逻辑通常由C#驱动。然而,当我们需要进行复杂的数据分析、机器学习推理、科学计算…

2026/7/24 0:03:10

不同品牌斜齿行星减速机如何替换?以PX与PAG系列为例

不同品牌斜齿行星减速机如何替换?以 PX 与 PAG 系列为例 一、系列对应不等于型号直接互换 PX 与 PAG 都属于斜齿、方法兰、输出轴式精密行星减速机,结构形式和应用方向具有对应关系。 原设备使用PX系列时,可以优先从PAG系列中寻找替换型号。但…

2026/7/24 0:03:10

jdk8 把list 扁平化成String 多个以逗号分隔

在 JDK 8 中&#xff0c;将 List 扁平化为以逗号分隔的 String&#xff0c;有几种非常简洁且高效的方法。&#x1f680; 推荐方案&#xff1a;使用 Collectors.joining()这是最标准的 Java 8 写法&#xff0c;适用于 List<String>。javaimport java.util.stream.Collecto…

2026/7/24 0:03:10

java 两个 long id 怎么合并成一个long id 并且不重复

“把两个 Long ID 合并成一个唯一的 Long ID&#xff0c;且保证不重复”这个需求&#xff0c;在 Java 里直接做数学上的“完美合并”是不可能的。因为两个 Long&#xff08;各 64 位&#xff09;要合并成一个 Long&#xff08;64 位&#xff09;&#xff0c;在信息论上是有损压…

2026/7/23 23:42:43

3个高效策略:快速掌握Axure中文界面配置

3个高效策略&#xff1a;快速掌握Axure中文界面配置 【免费下载链接】axure-cn Chinese language file for Axure RP. Axure RP 简体中文语言包。支持 Axure 11、10、9。不定期更新。 项目地址: https://gitcode.com/gh_mirrors/ax/axure-cn 还在为Axure RP的英文界面感…