发布时间:2026/9/6 19:48:13
scientific-agent-skills 中的 Aeon 时间序列聚类实战:从距离度量、均值方法到深度聚类器 scientific-agent-skills 中的 Aeon 时间序列聚类实战从距离度量、均值方法到深度聚类器【免费下载链接】scientific-agent-skillsTurn any AI agent into an AI Scientist. The #1 Agent Skills library for science, used by 190,000 scientists worldwide. 165 ready-to-use validated skills plus 100 scientific databases covering biology, chemistry, medicine, and drug discovery. Compatible with Cursor, Claude Code, Codex, Pi, Antigravity, and the open Agent Skills standard.项目地址: https://gitcode.com/GitHub_Trending/cl/scientific-agent-skills本篇围绕 scientific-agent-skills 仓库中 aeon 技能的聚类参考文档 clustering.md 展开系统讲解 Aeon 为时间序列定制的聚类算法族——分区算法、大规模数据集方法、弹性距离聚类、谱聚类、深度聚类器与特征型聚类器——并逐一说明其适用场景、距离度量与均值方法的选择依据。读完本文后你可以针对时间序列已对齐 / 存在时间偏移 / 数据量巨大 / 需要可解释特征等不同数据特征快速选定合适的聚类方案并基于fit_predict、cluster_centers_等标准接口搭建可复现的聚类流水线。1. 技能背景与运行环境aeon 技能位于仓库的 skills/aeon/SKILL.md是面向时间序列机器学习的 Agent 技能覆盖分类、回归、聚类、预测、异常检测、分割与相似性搜索等任务。其 Front Matter 声明了明确的适用边界适用于时序数据、序列模式或时间索引观测且需要超越标准 ML 方法的专用算法的场景要求Python 3.10依赖aeon包通过uv pip install安装深度学习及扩展依赖需要aeon[all_extras]技能版本基于aeon 1.x文档对标 v1.4.01.0 版本重构了预测与变换模块导入路径与 0.x/sktime 时代不同。在测试侧tests/skill-requirements.toml 中声明了该技能的最小运行包集合[skills.aeon] packages [aeon, matplotlib, numpy, scikit-learn]安装命令引自 SKILL.mdzsh 下需给 extras 加引号uv pip install aeon1.4,2 # 需要深度学习估计器时 uv pip install aeon[all_extras]1.4,2SKILL.md 同时提示上游将 forecasting、anomaly_detection、segmentation、similarity_search、visualisation 视为实验性模块而clustering 属于稳定模块可以放心用于生产流水线——这正是本文聚焦聚类的原因。2. 聚类算法族总览Aeon 的核心价值在于为时序数据提供了专用距离度量与均值方法使其聚类算法不再是把时间序列摊平后做普通 k-means而是真正在形状空间上运算。参考文档将算法划分为六类下面逐类说明。2.1 分区算法Partitioning标准 k-means/k-medoids 的时序适配版算法说明TimeSeriesKMeans支持时序距离度量DTW、Euclidean 等的 K-meansTimeSeriesKMedoids以真实时间序列作为聚类中心medoid 语义中心必然可解释TimeSeriesKShape基于形状的聚类算法TimeSeriesKernelKMeans核方法变体适合非线性模式适用条件已知聚类数目、预期簇形状近似球形。2.2 大规模数据集方法TimeSeriesCLARA—— Clustering LARge Applications通过采样逼近 k-medoidsTimeSeriesCLARANS—— CLARA 的随机化搜索变体。适用条件数据集大到标准 k-medoids 无法承受需要可扩展性。2.3 弹性距离聚类专为对齐型相似度设计KASBA—— 带平移不变弹性均值shift-invariant elastic averaging的 K-meansElasticSOM—— 使用弹性距离的自组织映射Self-Organizing Map。适用条件时间序列之间存在时间平移或形变warping。这类算法在步态、心电、工业信号等同一模式、不同相位的数据上尤为合适。2.4 谱方法Spectral MethodsKSpectralCentroid—— 带质心计算的谱聚类。适用条件簇形状非凸、需要基于图的聚类思路时。2.5 深度学习聚类基于自编码器的神经网络聚类通过学到的低维表示做聚类聚类器编码器结构AEFCNClusterer全卷积自编码器Fully ConvolutionalAEResNetClusterer残差网络自编码器AEDCNNClusterer膨胀卷积Dilated CNN自编码器AEDRNNClusterer膨胀 RNN 自编码器AEBiGRUClusterer双向 GRU 自编码器AEAttentionBiGRUClusterer注意力增强的 BiGRU 自编码器适用条件大数据集、需要学习式表示、或存在复杂非线性模式。注意这类估计器属于可选扩展需要aeon[all_extras]提供的深度学习依赖。2.6 基于特征的聚类Feature-Based先把时间序列变换到特征空间再在特征上聚类Catch22Clusterer—— 基于 22 个经典时序特征Catch22SummaryClusterer—— 基于描述性统计量TSFreshClusterer—— 基于 tsfresh 自动特征。适用条件原始序列难以直接刻画、需要可解释特征时。这与 transformations.md 中介绍的Catch22、TSFresh、SevenNumberSummary等CollectionTransformer一脉相承——特征型聚类器本质上是变换器 常规聚类器的组合封装。2.7 组合ClustererPipelineClustererPipeline允许把变换器与聚类器串联搭建自定义聚类流水线例如先Normalizer归一化再交给TimeSeriesKMeans。3. 快速上手DTW 重心均值的 KMeans参考文档给出的 Quick Start 完整继承如下。这里用 GunPoint 手势识别数据集的训练集做无监督聚类以分类数据充当聚类输入距离选用 DTW均值方法选用重心平均barycentric averagingfrom aeon.clustering import TimeSeriesKMeans from aeon.datasets import load_classification # 加载数据借用分类数据集做聚类演示 X_train, _ load_classification(GunPoint, splittrain) # 对时间序列做聚类 clusterer TimeSeriesKMeans( n_clusters3, distancedtw, # 使用 DTW 距离 averaging_methodba # 重心平均barycentric averaging ) labels clusterer.fit_predict(X_train) centers clusterer.cluster_centers_要点解读distancedtw让簇内距离计算走弹性对齐路径而非逐点比较适合存在相位偏移的序列averaging_methodba决定cluster_centers_如何由簇成员平均得到这是时序聚类与普通 k-means 最本质的差异点见第 5 节fit_predict/cluster_centers_与 scikit-learn 生态完全一致的估计器 API可直接接入Pipeline、交叉验证等既有工具。数据加载方面datasets_benchmarking.md 说明自 aeon 1.4 起多数分类/回归归档托管在 Zenodo首次使用时自动下载并缓存也可用get_dataset_meta_data(GunPoint)查看样本数、长度、类别数等元数据用于评估数据规模是否适合所选算法。4. 距离度量聚类质量的底层决定因素聚类文档列出的兼容距离度量分为四组与 distances.md 的完整目录相互印证类别度量特点Lock-step逐点Euclidean、Manhattan、Minkowski无对齐速度最快要求序列已对齐弹性带对齐DTW、DDTW、WDTW允许时间轴形变DDTW 比较导数对幅度偏移更稳健编辑型ERP、EDR、LCSS容忍缺失/插入型差异LCSS 对离群点鲁棒性最高专用弹性MSM、TWE针对特定形变模式设计从 distances.md 的复杂度分析看距离选择直接决定聚类的可扩展性Euclidean 为 O(n)带窗口约束的 DTW 为 O(nw)w 为窗口宽度全量 DTW 为 O(n²)。因此在大集合上聚类时实践中应给 DTW 加 Sakoe-Chiba 窗口约束# 窗口约束序列长度的 10%兼顾速度并抑制病理性形变 clusterer TimeSeriesKMeans(n_clusters3, distancedtw, distance_params{window: 0.1})同时多数距离对尺度敏感聚类前建议做 z 归一化SKILL.md 的 Best Practices 亦将此列为第一建议from aeon.transformations.collection import Normalizer X_train Normalizer().fit_transform(X_train)此外distances.md 还提供了get_distance_function_names()与get_distance_function(dtw)两个动态查询入口可以在运行时枚举并获取可用距离函数便于脚本化地做度量对比实验。5. 均值方法Averaging Methods如何得到簇中心时序聚类中最容易被忽视、却直接影响cluster_centers_含义的设计是簇中心的计算方式。参考文档列出四种均值方法均值方法说明mean_average逐点算术平均最快但忽略形变ba_average基于 DTW 的重心平均barycentric averaging是弹性距离下的经典选择kasba_average平移不变的弹性平均shift_invariant_average通用的平移不变平均适用条件原文档归纳当你需要用于可视化或初始化的代表性簇中心时需要显式选择均值方法。理解要点在于使用mean_average时DTW 距离下的簇中心只是逐点平均可能不落在任何典型形状上使用ba_average时中心是通过 DTW 重心对齐迭代得到的时序更适合作为聚类原型展示若数据主要是相位平移关系kasba_average/shift_invariant_average这类平移不变方法能避免中心被不同相位平均成噪声。这与算法选型一致KASBA本身就是K-means 平移不变弹性均值的组合适合时间平移显著的场景。6. 算法选型决策表综合参考文档的 Algorithm Selection 与距离/均值分析可以整理成如下决策表原文档六条优先级策略完整保留并补注首要诉求推荐算法依据速度优先TimeSeriesKMeans EuclideanLock-step 距离 O(n)无对齐开销需要对齐时间形变KASBA、TimeSeriesKMeans DTW弹性距离 合适的均值方法大数据集TimeSeriesCLARA、TimeSeriesCLARANS采样/随机搜索保证可扩展性复杂非线性模式深度聚类器AE*Clusterer系列自编码器学习表示可解释性Catch22Clusterer、SummaryClusterer特征空间可直接命名每个维度非凸簇形状KSpectralCentroid基于图的谱方法不受球形假设约束7. 评估从内部指标到带标签数据参考文档的评估部分建议使用 sklearn 或 aeon benchmarking 的聚类指标轮廓系数Silhouette score簇内紧密度与簇间分离度的综合度量Davies-Bouldin 指数越小越好衡量簇间可分离性Calinski-Harabasz 指数越大越好衡量簇间/簇内方差比。from sklearn.metrics import silhouette_score, davies_bouldin_score, calinski_harabasz_score # 需要基于所选距离度量重建距离矩阵后再计算如 DTW 距离矩阵 print(silhouette_score(X, labels, metricprecomputed))当手头有真实标签时例如直接用 GunPoint 的类别标签评估无监督结果还可以用 aeon benchmarking 提供的聚类专用指标——datasets_benchmarking.md 中给出了带标签匹配的聚类准确率from aeon.benchmarking.metrics.clustering import clustering_accuracy accuracy clustering_accuracy(y_true, y_pred)实践建议无标签场景用内部指标对比不同距离, 均值方法组合有标签场景用clustering_accuracy校验并以简单基线Euclidean KMeans作为参照避免仅凭单一指标下结论。8. 小结与延伸阅读aeon 技能中的聚类参考文档以距离度量 × 均值方法 × 算法族三个维度组织了完整的时序聚类选型空间分区算法处理常规场景CLARA/CLARANS 处理规模KASBA/ElasticSOM 处理相位形变谱方法处理非凸结构自编码器聚类器处理复杂模式特征型聚类器则换取可解释性。所有算法共享 scikit-learn 风格 API可直接与仓库其他技能文档中的变换器transformations.md、距离函数distances.md和数据加载工具datasets_benchmarking.md自由组合成完整流水线。延伸阅读路径skills/aeon/SKILL.md —— 技能总览、安装与数据格式规范集合为(n_cases, n_channels, n_timepoints)单序列为(n_channels, n_timepoints)skills/aeon/references/distances.md —— 全部距离度量、窗口约束参数与复杂度对照表tests/skill-requirements.toml —— 技能测试所需的最小依赖声明。【免费下载链接】scientific-agent-skillsTurn any AI agent into an AI Scientist. The #1 Agent Skills library for science, used by 190,000 scientists worldwide. 165 ready-to-use validated skills plus 100 scientific databases covering biology, chemistry, medicine, and drug discovery. Compatible with Cursor, Claude Code, Codex, Pi, Antigravity, and the open Agent Skills standard.项目地址: https://gitcode.com/GitHub_Trending/cl/scientific-agent-skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/9/6 19:48:13

5G物联网+智慧物流园区综合解决方案:架构与落地避坑全解析

简介:面向智慧物流园区数字化升级的5G物联网综合解决方案PPT,共69页,适合物流园区管理者、系统集成商及智慧城市方案规划人员参考,重点讲清5G如何与物联网、云计算协同支撑安防、物管与办公三大场景。压缩包内包含1个pptx演示文件…

2026/9/6 19:48:13

IT运维事件单与服务申请表:从设计到落地的完整指南

简介:面向IT运维团队与服务台人员的标准表单模板,将IT运维事件单与IT服务申请表合成一体,适用于互联网企业日常IT服务管理场景,可规范故障、问题、改进、咨询、业务需求等事件的申报、受理、分派与闭环反馈,适合运维工…

2026/9/6 19:48:13

WavLM 全栈语音预训练模型完整指南:加载、选型与调优

WavLM 全栈语音预训练模型完整指南:加载、选型与调优 【免费下载链接】unilm Large-scale Self-supervised Pre-training Across Tasks, Languages, and Modalities 项目地址: https://gitcode.com/GitHub_Trending/un/unilm WavLM 是微软推出的大规模自监督…

2026/9/6 20:33:15

MaxKB 部署教程:10 分钟跑通你的第一个知识库问答

MaxKB 部署教程:10 分钟跑通你的第一个知识库问答 【免费下载链接】MaxKB 🔥 MaxKB is an open-source platform for building enterprise-grade agents. 强大易用的开源企业级智能体平台。 项目地址: https://gitcode.com/GitHub_Trending/ma/MaxKB …

2026/9/6 20:33:15

GNOS-II不均匀DDM海面高度反演:重跟踪与误差修正全流程

简介:围绕风云三号E星GNOS-II载荷的GNSS-R海面高度反演研究,提供配套论文复现资料,面向卫星遥感、海洋测高及GNSS-R技术科研人员。内容以数据预处理、物理模型反演、随机森林与卷积神经网络实现为主线,对比北斗BDS与GPS反射信号性…

2026/9/6 20:33:15

MAKINO加工中心换刀臂更换全流程:从故障判断到调试验证

简介:针对Makino数控机床换刀臂更换维护的实操型PPT,由设备维修人员整理,面向数控机床维护工程师、机修技师及自动化产线技术员。资源以图文步骤形式,覆盖拆前清洁备料、断电断气锁定挂牌、护罩与换刀门拆除、连接件标记、锁紧背帽…

2026/9/6 20:33:15

Makino换刀臂更换全流程:拆装、调整与验证指南

简介:针对Makino高端数控机床换刀臂更换的PPT技术资料,面向数控设备维修人员、机修工程师及车间技术骨干。内容以图文形式完整呈现换刀臂更换全流程,包括机床清理、断电断气等安全措施、外围护罩与内部护板拆卸、连接件标记、花键套及轴承抽取…

2026/9/6 20:28:14

食品微生物检验质量控制全流程详解:关键环节与实操要点

简介:这是一份食品微生物检验质量控制的专题PPT,面向食品检验实验室人员、质量管理岗及相关专业学生,帮助系统理解微生物检验所需的国内外标准规范与操作要点。资源为单个PPT文件,约1.5MB,内容依次讲解ISO 7218、SN/T …

2026/9/6 0:06:59

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/6 0:06:59

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/6 0:06:59

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/6 0:06:59

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/6 0:06:59

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/6 0:06:59

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/6 11:40:10

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/6 19:33:50

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/6 10:19:40

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…