发布时间:2026/8/28 18:54:56
快速入门深度学习01:神经元和神经网络 开篇之前我详细写过两个专栏分别为《快速入门CV》和《快速入门NLP》讲道理这两个专栏针对原理是写的挺详细的但是想要快速上手的话其实要学的知识还是蛮多的。因此针对这部分我打算再好好写一下尽量精简一些同时形成文档可以提供给大家离线查阅。那么要想快速入门深度学习神经网络有点像这个领域的普通话了基本上不可能绕过去所以今天就从神经元和神经网络开始。1 神经元我们所说的神经网络基本单元可以视为神经元是仿生学的概念因此其实深度学习其实也是在模拟我们的大脑。1.1 生物神经元的启发人类大脑里的生物神经元工作逻辑其实很简单通过树突接收四面八方的信号在胞体里把信号整合起来如果总刺激超过了某个阈值就通过轴突把信号传给下一个神经元。简单说就三件事接收信号、整合信号、决定要不要激活输出。上世纪40年代研究者把这套逻辑抽象成了数学模型也就是MP人工神经元模型。它就是整个人工神经网络最基础的计算单元。1.2 一个神经元到底在算个啥我们拿预测冰淇淋销量举例子输入是温度、星期几这些特征一个神经元就是对这些特征做一次打分然后进行预测。定义输入特征为向量每个特征对应一个权重 再加上一个偏置项 。 神经元的计算分成两步第一步线性加权求和把每个特征乘以对应的重要程度全部加起来再加上偏置量权重可以理解成「这个特征对结果影响有多大」可正可负偏置相当于给结果设置一个基准线避免所有输入都是0的时候神经元直接没输出。第二步非线性激活光有加权求和还不够我们还要把结果送入激活函数得到神经元最终的输出目前工程里最常用的激活函数是ReLU逻辑非常简单 输入大于0就原样输出小于等于0直接输出0。1.3 激活函数非用不可吗其实一开始我学激活函数的时候并没有过多的思考它的作用和必要性而是文章里这么说我就这么记随着学的深入其实慢慢就能理解。但是在这里还是和大家介绍一下它的作用并且知乎上有很多大佬举了很多生动的例子尤其是有一个掰铁丝的例子让我印象深刻有兴趣的朋友可以去搜索一下。我们直接上结论如果没有激活函数无论堆叠多少层神经元整个网络都等价于一层线性变换。再多的层数也只是反复做矩阵乘法其实这是线性操作到最后依然只能表达简单的直线关系。可现实世界里的规律大多都不是直线咋说呢感觉神经元做的操作感官上有点类似于直线模拟的函数有限激活函数可以假如非线性元素可以模拟各种曲线。所以呢激活函数给网络引入非线性能力。有了这一步“掰弯”模型才有能力去拟合那些复杂的、弯弯曲曲的函数曲线。你要把深度学习最后学到的模型视为一个无比复杂的函数那么它的函数图像必然不是一个直线当然一般其实也画不出来。当然单个神经元的能力还是很有限的。面对复杂的数据模式只靠一个单元远远不够。那怎么办由此我们想到了堆叠神经元神经形成网络。2 单层感知机的局限把输入直接连到输出神经元中间没有其他单元这就是单层感知机。单层感知机可以自动学习权重完成简单的二分类任务。但研究者很快就发现了它的致命问题。2.1 解决不了异或问题MP只能处理线性可分的数据。最经典的例子就是XOR异或问题输入两个相同输出0输入不同输出1。就这么简单的逻辑MP怎么都做不到。很明显无论怎么调整权重光靠直线无法区分class0和1。那么到是什么导致的呢因为缺少一层能做特征空间变换的中间层。聪明的你会想到原始空间里分不开的数据能不能先把它映射到另一个空间让它在新空间里变得可分顺着这个思路研究者加入了隐藏层多层感知机MLP就应运而生了。3 多层感知机MP隐藏层一个基础的多层感知机由输入层、隐藏层、输出层三部分构成。3.1 三层网络分别干什么活输入层不做任何计算只负责接收和传递原始数据隐藏层网络真正的干活儿的地方。一层里有很多神经元每个神经元都对上一层的数据做加权求和激活。原始特征经过这一层就被映射到了新的特征空间输出层接收隐藏层变换好的特征输出最终的预测结果。回归任务输出数值分类任务输出类别结果。3.2 前向传播我们拿只有一层隐藏层的网络举例过一遍完整的计算流程。设 是输入层到隐藏层的参数 是隐藏层到输出层的参数。先算隐藏层的输出再算最终的预测输出整个过程就是原始输入经过隐藏层做一次非线性变换变换后的特征再交给输出层计算得到最终结果。3.3 前向传播解决的问题有一个很重要的理论叫万能逼近定理只要隐藏层的神经元数量足够多单隐藏层的神经网络就能以任意精度逼近任意连续函数。这句话相当于给研究者吃了一颗定心丸多层网络在理论上拥有足够强的表达能力。理论上你就去堆网络吧最终肯定能对出你想要的函数模型。但是理论可行不代表训练可行。网络刚初始化的时候所有权重、偏置都是随机生成的。拿随机参数跑出来的结果基本等同于瞎猜。那怎么让这些参数自动调整让预测越来越准这里就会涉及一整套神经网络训练流程用损失函数衡量错了多少用梯度下降找更新方向再用反向传播把误差一层层传回去。这一块涉及不少推导全部铺开的话篇幅会很长。所以损失函数、梯度下降、反向传播这些训练相关的内容我们放到下一篇文章完整讲解。本篇我们先把网络本身的结构和前向逻辑吃透。4 深度神经网络再和大家说一下深度神经网络刚才我们只用到了一层隐藏层。如果继续堆叠更多隐藏层每一层都做一次线性变换激活就得到了深度神经网络也就是我们常说的深度学习。层数加深之后网络会形成一种逐层抽象的特征提取逻辑。拿图像识别举例子就很好懂浅层神经元捕捉边缘、简单纹理中间层组合边缘识别轮廓、局部形状更深层再把局部形状组合起来得到物体的整体特征。每一层都在上一层的基础上做进一步的加工和抽象。当然层数变多也会带来新问题。比如大家常听说的梯度消失、过拟合。这些都属于训练优化层面的问题我们留到后面再展开。总结一下人工神经元灵感来自生物神经元核心是加权求和 非线性激活激活函数是网络拥有非线性能力的关键。单层感知机只能处理线性可分任务面对XOR这类简单非线性问题都束手无策。加入隐藏层得到多层感知机MLP通过特征空间变换解决了非线性拟合问题理论上足够多的神经元可以逼近任意连续函数。多层网络的前向传播就是数据从输入层开始逐层做线性计算激活一路流向输出层。网络初始参数都是随机值想要让模型学会规律需要完整的训练机制。训练部分我们下一篇详细拆解。本质上来说神经网络就是一套带可学习参数的分层函数映射框架。现在就粗暴的理解为函数吧我们后来熟悉的CNN、RNN、Transformer底层都建立在这套基础逻辑之上。所以说它是深度学习领域的普通话一点都不过分。

相关新闻

2026/8/28 18:49:56

Ubuntu24系统安装部署最新版K8s(Kubernetes)1.36保姆级详细教程

一、集群节点规划注意:Kubernetes 1.36 已经彻底移除 docker shim,只能使用 containerd/crun,不再支持 docker 直接作为 runtime。软件环境操作系统Ubuntu 24.04.4 LTS 内核6.8.0-138-genericContainerdv2.2.1k8sv1.36.4kubeadmv1.36节点配置…

2026/8/28 18:49:56

LINGO优化建模:从数学公式到运输问题实战

1. 从“数学建模”到“LINGO”:为什么它依然是你的秘密武器如果你正在准备数学建模竞赛,或者在工作中遇到了需要优化决策的问题,比如“如何安排生产计划成本最低”、“如何设计物流路线效率最高”,那么你大概率会听到一个名字&…

2026/8/28 18:49:56

UVC消毒笔嵌入Nordic BLE SoC的完整工程复盘

UVC消毒笔这个品类,前两年市场需求突然就起来了,各路方案商、品牌方、初创团队都往里冲。当时市面上大多数产品还停留在“一颗电池一个升压板一颗灯珠”的阶段,讲究点的加个机械拨杆开关,没了。而“UVC Disinfecting Pen Embeds N…

2026/8/28 19:35:03

Claude Code 安装配置与低成本模型接入实战指南

先说明一个基本判断:在 2025 年这个时间点,AI 编程助手的竞争已经不再只是“谁写代码写得聪明”,而是“谁能在同样的代码质量下,让团队成本结构变得更健康”。Claude Code 之所以被广泛讨论,不仅因为它在 Agent 式编码…

2026/8/28 19:35:02

手机AI Agent国标L3详解:能力分级、技术栈与工程落地

最近两周,手机厂商和 AI 社区讨论最频繁的词,已经从“大模型参数”变成了“AI Agent”。尤其在国内手机圈,「国标 L3」这个概念被反复提及。很多开发者第一次看到时会下意识以为它和通信网里的 L2/L3 信令流程有关,其实两者完全不…

2026/8/28 19:35:02

深圳设计公司给你的Logo压缩包,如果里面只有.ai和.jpg

深圳设计公司给你的Logo压缩包,如果里面只有.ai和.jpg,等于给了你一把没开刃的刀“Logo收到了,有AI文件,有JPG图片,应该齐了吧?”很多深圳老板验收设计成果的时候,看到压缩包里有这两个格式&…

2026/8/28 19:30:02

大模型架构演进:Transformer瓶颈与下一代架构方向解析

大模型圈子里最近有一个信号值得关注:有在 OpenAI 和 Google 长期负责大模型核心方向的研究者,离开头部实验室之后,明确把下一站押注在“下一代架构”上。这件事本身比“哪家公司又发了新模型”更值得技术人跟进。因为头部厂商的核心负责人通…

2026/8/28 16:16:17

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/28 16:16:21

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/28 16:16:22

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/28 0:00:34

2026学术工具专业测评|Paperxie全维度性能实测报告[特殊字符]

2026年国内高校毕业论文审核体系全面升级,重复率查重AIGC人工智能检测双检机制正式常态化落地,多所高校明确执行“双项一票否决”制度,重复率超标或AI生成痕迹不达标,均直接取消答辩资格。随着抽检力度加大、学术规范要求升级&…

2026/8/28 0:00:34

凭什么稳居论文工具顶流[特殊字符]Paperxie综合实力深度全解析

2026年论文双检内卷严重,市面上AI论文工具层出不穷,但大多只是单一功能凑数、模板化严重、双检高风险、套路收费。 在一众同质化工具里,Paperxie能长期稳居行业顶流、成为应届生公认毕业神器,从来不是靠营销,而是靠实…

2026/8/28 0:00:34

2026论文工具深度测评|为什么Paperxie是目前最稳的学术工具✅

2026高校论文查重AIGC双检严查常态化。 市面上绝大多数AI论文工具依旧存在明显短板:模板感重、AI痕迹超标、改写毁逻辑、收费套路多、查重不准、格式适配差。 在全网工具普遍“偏科”的现状下,Paperxie凭借全维度均衡实力脱颖而出,成为适配…

2026/8/28 16:16:48

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/28 16:16:50

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/28 11:06:45

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…