发布时间:2026/8/26 13:38:01
Python实现 K-Means聚类(jupyter notebook) 目录聚类的概念聚类的要求应用领域K-Means算法步骤聚类结果性能度量优点缺点代码实现手写代码调用sklearn 进行k-means聚类的概念聚类是把各不相同的个体分割为有更多相似性子集合的工作。聚类生成的子集合称为簇聚类的要求生成的簇内部的任意两个对象之间具有较高的相似度属于不同簇的两个对象间具有较高的相异度聚类与分类的区别在于聚类不依赖于预先定义的类没有预定义的类和样 本 ——聚类是一种无监督的数据挖掘任务应用领域客户价值分析文本分类基因识别空间数据处理卫星图片分析数据分析、统计学、机器学习、空间数据库技术、生物学和市场学也推动了聚类分析研究的进展K-Means算法步骤随机选取K个样本作为类中心计算各样本与各类中心的距离将各样本归于最近的类中心点求各类的样本的均值作为新的类中心判定若类中心不再发生变动或达到迭代次数算法结束否则回到第2步。聚类结果性能度量内部指标(internal index)Compactness紧密性(CP):各样本到聚类中心的平均距离每一类样本到样本中心的聚离的均值然后求类距离均值的均值Separation间隔性(SP):各类中心间的平均距离cp越小越好sp越大越好(k值越大即分类越多cp值越小所以并不是cp越小越小要结合实际情况)优点算法简单易于理解对球形簇样本聚类效果好分k均值等变种算法运行良好不受初始化问题的影响。缺点不能处理非球形簇、不同尺寸和不同密度的簇对离群点、噪声敏感代码实现手写代码from sklearn.datasets import load_iris import numpy as np iris load_iris() data iris.data k 2 #设置聚类中心 n len(data) dist np.zeros([n,k1]) #1.选中心 center data[:k, :] center_new np.zeros([k, data.shape[1]]) while True: #2.求距离 for i in range(n): for j in range(k): dist[i, j] np.sqrt(sum((data[i, :] - center[j, :])**2)) dist[i,k] np.argmin(dist[i, :k]) #求最小值的位置,并归类 # 4.求新类中心 for i in range(k): index dist[:,k] i #找到不同类类索引 center_new[i, :] data[index, :].mean(axis0) #求同类的新样本中心 #5.判定结果 if np.all(center center_new): break center center_new print(dist) #查看聚类结果聚类结果如下第一列为样本到第一个聚类中心的距离第二列为样本到第二个聚类中心的距离第三列为聚类的结果即距离哪个聚类中心最近的划分为该类。调用sklearn 进行k-meansfrom sklearn.datasets import load_iris from sklearn.cluster import KMeans iris load_iris() model KMeans(n_clusters3).fit(iris.data) model.labels_ #查看聚类结果聚类结果如下

相关新闻

2026/8/26 13:38:01

「干货分享」DevExpress常用控件——RichEditControl使用指南

做WinForms的一般都知道,传统.NET界面有一个RichTextBox控件,这个是一个富文本控件,可以存储图片文字等内容,它有自己的文件格式RTF,在DevExpress控件组里面也有一个同等的控件,他的名字是RichEditControl&…

2026/8/26 13:33:00

shell编程---替换运算符

替换运算符1、{: }运算符规则:1、若未定义该变量或者该变量值为空,则将用运算符后面的值赋值给该变量2、变量值不为空,不更新变量值。#! /bin/bash PRINT"Remind some import things" echo $PRINTecho ${STRING1:hello}…

2026/8/26 14:23:37

如何把历史pprof数据导入profefe?pprof_import.sh实战指南

如何把历史pprof数据导入profefe?pprof_import.sh实战指南 【免费下载链接】profefe Continuous profiling for long-term postmortem analysis 项目地址: https://gitcode.com/gh_mirrors/pr/profefe profefe 是面向长期事后分析的持续剖析(Cont…

2026/8/26 14:18:35

ICSHM2021 P2结构健康监测图像分割建模

图像分割已成为结构健康监测中不可或缺的技术手段,广泛应用于桥梁、建筑等工程设施的损伤识别中。高效、精准的分割模型对提升结构安全判断具有深远意义。 本文基于ICSHM2021 P2损伤状态分割任务,系统介绍数据结构、建模流程与关键算法思路,聚焦深度学习在工程图像分割中的…

2026/8/26 9:13:28

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/25 11:48:27

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/25 16:56:43

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/26 0:04:32

Python random 模块常用函数详解:从入门到实战

目录 1. 引言2. 准备工作3. 基础随机函数4. 序列相关函数5. 随机种子与复现6. 实战案例7. 注意事项8. 常见问题与排查9. 总结 1. 引言 摘要: 本文系统介绍 Python 标准库 random 模块中最常用的随机数生成函数。内容涵盖基础随机函数(random()、unifor…

2026/8/26 1:19:35

JSON总结

JSON概念 JSON(JavaScript Object Notation) 是一种轻量级的数据交换格式,主要用于跟服务器进行交换数据。它基于ECMAScript的一个子集。 JSON采用完全独立于语言的文本格式,但是也使用了类似于C语言家族的习惯(包括C、C、C#、Java、JavaScr…

2026/8/26 1:19:35

保存连接sse 是什么原理,为什么不会一直请求

“保持连接”用的是 SSE(Server-Sent Events),本质是一个没有马上结束的 HTTP 请求。 过程是: 拷贝机发送一次请求: GET /api/code-sync/events服务器返回: Content-Type: text/event-stream但不关闭响应&…

2026/8/24 13:42:17

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/24 18:13:48

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/25 1:08:14

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…