【机器学习】(27)—— 神经网络多分类

发布时间:2026/9/14 15:18:57

【机器学习】(27)—— 神经网络多分类 神经网络多分类一对多和 Softmax文章目录神经网络多分类一对多和 Softmax1. 选项从两个变成多个2. 一对多每个类确认一次2.1 放到一张网络里3. Softmax在类与类之间分概率4. 汽车例子按重量分三档5. 和多标签区分6. 动手Iris 上对比逻辑回归与 MLP7. 实现时几个容易混的点8. 适用边界与常见误区8.1 适用边界8.2 常见误区9. 关键术语速查10. 延伸阅读11. 小结摘要专栏前半段的分类多是「高效 / 非高效」二选一。车型档位、故障类型、手写数字这类问题选项往往有三个以上而且每个样本只属于其中一类。第 13 篇从通用角度介绍过多分类本篇把它接到神经网络输出层上讲清一对多one-vs-all和Softmax差在哪里、概率要不要加起来等于 1以及什么时候不该用 Softmax。适合读完浅层网络实践的读者。1. 选项从两个变成多个二分类输出一个概率p pp再靠阈值切成 0/1。多分类时标签变成0 , 1 , … , K − 1 0,1,\ldots,K-10,1,…,K−1模型要给出K KK个分数或概率最后通常取最大的那一类。二分类多分类单标签例子是否高效轻 / 中 / 重 三档输出1 个概率K KK个值约束p ∈ ( 0 , 1 ) p\in(0,1)p∈(0,1)Softmax 下各类概率和为 1和第 13 篇一样先分清多分类单选题每辆车只能落在一档多标签多选题一张图可以同时有「猫」和「户外」本篇默认讲单选题。多标签一般是每个标签各接一个 Sigmoid不要用 Softmax 硬凑。第 812 篇的阈值、混淆矩阵、精确率 / 召回率在多分类里仍然用得上只是混淆矩阵从2 × 2 2\times 22×2变成K × K K\times KK×K。第 13 篇已从「不用神经网络」的角度讲过 OvR / Softmax本篇重点是这些头接在 MLP 最后一层时该怎么选。2. 一对多每个类确认一次一对多One-vs-All / One-vs-Rest有K KK个类就准备K KK个二分类问题。对「轻 / 中 / 重」三档是不是轻对比不是轻是不是中是不是重预测时看哪个分类器最「肯定」或比较各自的分数。类数不多时这个想法很直观类数上到成百上千就维护成本高、也慢。2.1 放到一张网络里不必真的训练K KK个完全独立的模型。可以共用前面的隐藏层输出层放K KK个节点每个节点各自接Sigmoid每个输出表示「是不是这一类」的概率彼此独立估计。因此三者加起来不一定等于 1——有可能都偏低或都偏高。水果图的例子里网络可能给出「梨 0.84、葡萄 0.07……」加总超过 1这在一对多设定里并不奇怪它在分别回答「是不是梨」「是不是葡萄」而不是在「四种水果里只能选一个」的约束下分配概率。预测时常见做法是看哪一路 Sigmoid 输出最大就把该类当作预测若业务允许「都不像」也可以要求最大概率超过某阈值否则判为未知。阈值仍建议在验证集上定和第 09 篇同一思路。3. Softmax在类与类之间分概率若业务要求「轻、中、重三者互斥必须落在一档」更常见的是Softmax也常叫一对一 / one-vs-one 语境下的相对概率和第 13 篇用语一致即可。先对每个类算一个未归一化分数z j z_jzj​logits再p j e z j ∑ k 1 K e z k p_j \frac{e^{z_j}}{\sum_{k1}^{K} e^{z_k}}pj​∑k1K​ezk​ezj​​于是p j 0 p_j0pj​0且∑ j p j 1 \sum_j p_j 1∑j​pj​1。可以把它看成逻辑回归里 Sigmoid 往多类的推广Sigmoid 处理「是 / 否」Softmax 处理「在K KK个选项里挑一个」。手算一个小数设三档分数z ( 1.0 , 2.0 , 0.0 ) z(1.0,\ 2.0,\ 0.0)z(1.0,2.0,0.0)则e 1 ≈ 2.72 , e 2 ≈ 7.39 , e 0 1 e^{1}\approx 2.72,\quad e^{2}\approx 7.39,\quad e^{0}1e1≈2.72,e2≈7.39,e01分母≈ 11.11 \approx 11.11≈11.11于是p ≈ ( 0.24 , 0.67 , 0.09 ) p \approx (0.24,\ 0.67,\ 0.09)p≈(0.24,0.67,0.09)「中」档分数最高概率也被抬得最高提高某一档的z zz会挤占其他档的概率——这就是「互相竞争」。一对多 SigmoidSoftmax各类是否互斥建模不强求强求概率互相挤占概率和是否为 1不一定是典型用途类可近似独立判断单标签多分类默认选择类特别多例如上万类时完整 Softmax 算分母会贵工程上会用候选采样等近似入门阶段类数不大用完整 Softmax 即可。数值上算 Softmax 时常先减去max ⁡ k z k \max_k z_kmaxk​zk​再取指数避免e z e^{z}ez溢出。手算小例子不必纠结自己用 NumPy 实现时记得这一步。框架里的 Softmax 一般已处理稳定计算。4. 汽车例子按重量分三档把专栏里的重量粗分成三档标签演示用阈值可改档位条件千磅标签轻 3.0 3.03.00中3.0 3.03.04.0 4.04.01重 4.0 4.04.02二分类问「高不高效」这里问「偏轻、适中还是偏重」。特征仍可用重量、排量等输出层改为 3 个节点。若用 Softmax三个概率和为 1取 argmax 得档位。若用三个 Sigmoid更像三个独立「是不是这一档」的问题对互斥档位一般不如 Softmax 合适。损失方面Softmax 多分类常用交叉熵多类版 Log Loss。训练仍是前向算p pp、算损失、反向更新第 25 篇只是输出维数从 1 变成K KK。若训练集里「重」车特别少Softmax 仍可能偷懒少报「重」——第 20 篇的类别不平衡问题在多分类里同样存在需要看每类召回必要时加类别权重或重采样。5. 和多标签区分场景该用什么每张图只有一种主果蔬Softmax 多分类一碗里同时有苹果和橙子多个 Sigmoid / 多个二分类不用Softmax邮件垃圾 / 正常二分类 Sigmoid 即可故障码互斥的 5 种故障SoftmaxSoftmax 的假设是每个样本恰好属于一类。不满足就换输出头别硬套。训练标签也要一致若标注规范里允许「既算中型又算偏重」那是多标签问题应拆成多个是/否而不是强行塞进三个互斥档。和业务对齐标签定义往往比纠结隐藏层宽度更重要。6. 动手Iris 上对比逻辑回归与 MLPfromsklearn.datasetsimportload_irisfromsklearn.model_selectionimporttrain_test_splitfromsklearn.preprocessingimportStandardScalerfromsklearn.pipelineimportPipelinefromsklearn.linear_modelimportLogisticRegressionfromsklearn.neural_networkimportMLPClassifierfromsklearn.metricsimportaccuracy_score,log_loss,classification_report X,yload_iris(return_X_yTrue)X_train,X_test,y_train,y_testtrain_test_split(X,y,test_size0.25,random_state0,stratifyy)defeval_model(name,clf):pipePipeline([(scaler,StandardScaler()),(clf,clf)])pipe.fit(X_train,y_train)probapipe.predict_proba(X_test)predpipe.predict(X_test)print(name,{acc:round(accuracy_score(y_test,pred),3),logloss:round(log_loss(y_test,proba),3),})# Softmax 概率应按行求和为 1print( prob row sums:,proba.sum(axis1).round(3)[:5],...)returnpipe# 逻辑回归多分类默认可用 Softmaxmultinomialeval_model(logreg,LogisticRegression(max_iter1000,multi_classmultinomial),)eval_model(mlp,MLPClassifier(hidden_layer_sizes(8,),activationrelu,learning_rate_init0.01,max_iter2000,random_state0,),)看两件事准确率 / log loss 是否合理proba每一行是否加起来接近 1Softmax 行为。MLPClassifier在多类问题上会走 Softmax 风格的输出若你自己用底层框架搭网络输出层要明确写成 Softmax 交叉熵别和隐藏层的 ReLU 搞混。汽车三档数据可以把y换成按重量分箱的标签特征用weight、displacement等流程相同先标准化再 MLP再用混淆矩阵看哪两档最容易混第 09、13 篇。打印classification_report时重点看每一档的 precision / recall而不是只看总 accuracy。三档样本若几乎均衡准确率还算有参考价值若某一档极少总准确率容易虚高。7. 实现时几个容易混的点输出激活和隐藏激活不是一回事。隐藏层继续用 ReLU第 24、26 篇多分类输出才是 Softmax 或若干 Sigmoid。一对多的 Sigmoid 概率不要当成「已经归一化」。若产品文案写「三类概率加总 100%」就应上 Softmax或事后自己归一化并说明含义变了。类很多时。完整 Softmax 分母要对所有类求和。类数极大时候选采样等技巧会只对部分负类算分那是工程优化入门先把小K KK做对。评估。准确率在类别不平衡时仍可能骗人第 20 篇多分类更要看每类召回、宏平均 / 加权 F1以及K × K K\times KK×K混淆矩阵。和浅层网络实践怎么接。第 26 篇的圆环是二分类。改成三类点例如内、中、外三环后把MLPClassifier的标签换成 0/1/2输出自动变成三维 Softmax 概率调隐藏层宽度和学习率的方法不变。先保证二分类能分弯再加类数排查时更轻松。8. 适用边界与常见误区8.1 适用边界本篇接在神经网络输出层第 13 篇的 OvR / OvO 思想对树模型、SVM 同样适用。Softmax 管「选哪个类」不管特征脏不脏、有没有泄漏——第 1822 篇的检查仍然要做。回归预测 MPG 连续值不是 Softmax 的场景。8.2 常见误区误区更稳妥的理解多分类就是多标签单选 vs 多选输出头不同有K KK个 Sigmoid 输出概率必加总为 1一对多不保证Softmax 才保证隐藏层也要用 SoftmaxSoftmax 一般在输出层类一多就先上很深的网先确认标签是否互斥、数据是否够只报总准确率结合每类指标和混淆矩阵Softmax 概率能直接当校准很好的置信度未校准前别过度解读需要时再做概率校准9. 关键术语速查术语含义多分类每样本恰好一类K ≥ 3 K\ge 3K≥3一对多每类一个「是该类 / 不是」问题Softmax将K KK个分数变成和为 1 的概率logitSoftmax 之前的原始分数z j z_jzj​交叉熵多分类常用损失对接 Softmax多标签每样本可同时有多个标签10. 延伸阅读资源适合看什么专栏第 13 篇OvR、OvO、多分类与多标签专栏第 24 篇Sigmoid 与输出激活sklearn LogisticRegressionmulti_classmultinomialsklearn MLPClassifier多类 MLPIris 数据集三类小样本练习11. 小结神经网络做多分类关键在输出层怎么接一对多用K KK个 Sigmoid各类概率可以独立、加总不必为 1标签互斥时用 Softmax让概率在K KK类里互相竞争且加总为 1。隐藏层仍用 ReLU 一类激活和输出头分开选。互斥单标签 → Softmax 交叉熵 可重叠多标签 → 每标签 Sigmoid 二分类 → 一个 Sigmoid 即可汽车从「是否高效」换成「轻 / 中 / 重」后只是K KK从 2 变成 3前面的划分、标准化和过拟合处理并不过时。接输出头之前先确认标签互不互斥互斥用 Softmax可重叠用多个 Sigmoid。头接错了后面网络再深优化的也是错问题。下一篇会对神经网络做一次总结然后过度到后面的 Embedding 等内容。系列导航上一篇【机器学习】26—— 浅层神经网络下一篇预告神经网络小结与embedding如果本篇对你有帮助欢迎点赞、收藏、关注博主机器学习专栏持续更新中下次更新不迷路。
延伸阅读

更多相关文章

2026/9/13 15:59:38

LifeForge API密钥管理:安全存储和使用第三方服务凭证

LifeForge API密钥管理:安全存储和使用第三方服务凭证 【免费下载链接】lifeforge A self-hosted solution to streamline and organize all aspects of your life. 项目地址: https://gitcode.com/gh_mirrors/li/lifeforge LifeForge是一款自托管解决方案&a…

2026/9/15 12:07:28

CANoe16安装故障树分析:软硬耦合环境部署指南

1. 为什么CANoe16安装比普通软件更让人头疼——一个汽车电子工程师的真实体验CANoe16不是你装个PyCharm或VS Code就能立刻写代码的那种工具。它是一套嵌入式车载网络开发与测试的“操作系统级”平台,背后绑定了Vector自家的硬件驱动栈、许可证服务、数据库引擎、实时…

2026/9/15 12:07:28

npm实战指南:从依赖管理到install原理与高频报错排查

在JavaScript生态里待过哪怕一周的人,大概率都见过终端里跑npm install时那串刷着进度条的滚屏输出。npm全称Node Package Manager,随Node.js一起分发,是目前全球规模最大的开源软件注册表。它的核心价值就一句话:帮我管好“依赖”…

2026/9/15 12:07:28

Windows下FFmpeg实战:m4s/m3u8转换与视频合并切片指南

平时做视频相关工作,在 Windows 上处理录像、缓存视频和流媒体切片是家常便饭。我这次要处理一批课程录像,需要合并、切片,还要把移动端缓存下来的 .m4s 文件和网页端常见的 .m3u8 流媒体索引全部转成能直接用的 mp4。折腾一圈下来&#xff0…

2026/9/15 12:02:28

【电路笔记 仿真】SPICE仿真器软件 LTspice:绘制简单电路(新建图页+添加组件)并仿真+模型导入+SUBCKT (子电路)绘制与使用+特殊器件绘制

文章目录下载安装打开示例官方HELP调用新建图页添加组件绘制简单电路暂态仿真AC仿真频谱绘制Model配置SUBCKT (子电路)绘制子电路符号方法一(自动生成):方法二(手动绘制):使用SUBCKT (子电路)特殊器件绘制变压器传输线差分电压测量其他注意事项CGLTspice…

2026/9/15 4:54:30

拯救者Y7000黑屏故障排查与维修实战指南

1. 项目概述:一台黑屏的拯救者Y7000,到底卡在哪一步? 联想拯救者Y7000系列笔记本,从2018年第一代搭载i5-8300H开始,到后来的i7-9750H、i7-10750H、i5-11400H,再到2023年款的R7-7840HS,它始终是学…

2026/9/15 0:01:16

AI英语单词APP开发:自适应学习算法与移动端优化实践

1. 项目概述 作为一名在移动应用开发领域摸爬滚打多年的老手,我最近完成了一个AI英语单词APP的开发项目。这个项目将传统单词记忆方法与现代AI技术相结合,打造了一款能够智能适应不同用户学习习惯的英语学习工具。 市面上大多数单词APP都存在一个通病&a…

2026/9/15 0:01:16

Flutter与OpenHarmony结合开发手语学习APP实战

1. 项目背景与核心价值作为一名同时接触过Flutter和OpenHarmony的开发者,最近我完成了一个基于Flutter for OpenHarmony的手语学习APP实战项目。这个项目最大的特点在于实现了跨平台框架与国产操作系统深度结合的创新实践——用Flutter开发的应用能完美运行在OpenHa…

2026/9/15 0:01:16

六个月成为机器人工程师:从ROS2到SLAM的实战路径

1. 六个月的紧迫感从哪来:先搞清楚你要成为哪种机器人工程师说实话,六个月的期限并不是一个宽松的时间线。市面上任何一本正经的机器人学教材都超过五百页,ROS2的官方文档可以翻到你怀疑人生,再加上ABB、KUKA这些工业机器人厂家动…

2026/9/14 11:59:31

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/14 13:53:59

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/15 11:42:23

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码