数据科学生命周期入门:采集、处理与维护三阶段实战解析(Data-Science-For-Beginners)

发布时间:2026/9/11 1:30:03

数据科学生命周期入门:采集、处理与维护三阶段实战解析(Data-Science-For-Beginners) 数据科学生命周期入门采集、处理与维护三阶段实战解析Data-Science-For-Beginners【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners数据科学本质上是一个过程而非一次性任务。本文以微软 Data-Science-For-Beginners 课程的 第 14 课 为核心系统拆解数据科学生命周期中的数据采集Capturing、**处理Processing与维护Maintenance**三大阶段并借助仓库内的真实数据集与 Jupyter Notebook 给出可运行的实战样例。读完本文你将掌握如何定义可量化的问题目标、评估数据集质量、识别生命周期各阶段的技术选型以及如何用 TDSP 与 CRISP-DM 两种业界标准框架对照自己的项目流程。生命周期示意图图片来自 Berkeley School of Information维护环节贯穿于采集与处理之间是持续进行的过程。一、生命周期概览数据科学的五个阶段本课程开篇定义数据科学就强调数据科学的核心是从数据中提取知识并产出可执行的洞见而实现这一目标的方式是把它当作一个有始有终的过程来管理。该过程可以拆解为 5 个阶段数据采集Capturing获取数据并定义需要解决的问题与项目目标处理Processing在数据中发掘模式、构建模型分析Analysis确认数据能够回答提出的问题或验证模型是否正确解决问题对应课程 第 15 课Analyzing沟通Communication将数据结论以故事的形式传达给受众对应课程 第 16 课Communication维护Maintenance在整个项目周期内持续管理、存储与保护数据。本课聚焦其中三个部分采集、处理与维护。注意生命周期图上的关键细节——维护并非一个孤立的收尾步骤而是夹在采集与处理之间、贯穿项目全程的持续过程。整个生命周期章节共包含三课4-Data-Science-Lifecycle/README.md本课为其开篇。二、阶段一数据采集Capturing采集阶段是整个生命周期的基石后续所有阶段都依赖它因此它实际上合并了两个子步骤获取数据与定义需要解决的问题和项目目的。2.1 先定义问题与目标再谈数据定义项目目标需要对问题或疑问有更深的背景理解。首先要识别并接触到需要解决问题的人——通常是业务中的利益相关者stakeholders或项目赞助方他们能帮助明确谁会从项目中受益、受益什么、为什么需要。一个定义良好的目标应当是可测量、可量化的这样才能界定什么是可接受的结果。数据科学家在此阶段可以提出如下问题原文档完整保留这个问题之前是否有人尝试解决过发现了什么目的与目标是否被所有相关方理解是否存在歧义如何减少歧义约束条件是什么最终结果可能长什么样有多少可用资源时间、人力、算力2.2 识别、收集与探索数据确定目标之后下一步是识别、收集并最终探索达成目标所需的数据。在此过程中数据科学家必须评估数据的数量与质量这需要一定程度的探索性分析exploration以确认所收集的数据足以支撑期望的结果。关于数据本身数据科学家可以提出这些问题我目前已经有哪些数据这些数据的拥有者是谁存在哪些隐私顾虑我有足够的数据来解决这个问题吗对于该问题数据质量是否可以接受如果我从数据中发现了额外信息是否应考虑改变或重新定义目标2.3 仓库实战纽约出租车小费案例本课课后作业评估一个数据集就是采集阶段的最佳演练客户想了解纽约市黄色出租车乘客冬季与夏季哪季给司机的小费更多你的团队正处于生命周期的 Capturing 阶段需要负责处理数据集。仓库提供了带注释的 Notebooknotebook.ipynb与真实数据data/taxi.csv。数据来自纽约出租车与电召车委员会NYC Taxi Limousine Commission的黄色出租车行程记录Notebook 中的加载代码非常简洁#Install the pandas library !pip install pandas import pandas as pd path ../../data/taxi.csv #Load the csv file into a dataframe df pd.read_csv(path) #Print the dataframe print(df)运行后打印出的 DataFrame 为200 行 × 18 列从实际数据data/taxi.csv可以看到完整字段VendorID、tpep_pickup_datetime、tpep_dropoff_datetime、passenger_count、trip_distance、RatecodeID、store_and_fwd_flag、PULocationID、DOLocationID、payment_type、fare_amount、extra、mta_tax、tip_amount、tolls_amount、improvement_surcharge、total_amount、congestion_surcharge。观察真实数据可以发现几个与回答客户问题直接相关的要点数据横跨2019 年 7 月夏季与 2019 年 1 月冬季恰好覆盖了两个季节的对比需求tip_amount字段直接记录了每次行程的小费金额是回答问题的核心变量payment_type取值为 1信用卡与 2现金等而现金支付通常不产生小费记录这是评估数据质量时需要注意的偏差点congestion_surcharge在部分 2019 年 1 月的行程中为 0说明数据在时间上跨越了收费政策调整分析时需考虑该干扰因素。这正是采集阶段的典型任务不仅要拿到数据还要判断这份数据能否真正回答客户的问题、数据质量是否可接受。作业还要求你参考数据集字典data dictionary核对字段含义、探索 NYC Open Data 目录寻找可用于补充的额外数据集并写出 3 个需要向客户澄清的问题。三、阶段二处理Processing处理阶段聚焦于在数据中发现模式以及建模modeling。发现模式往往需要借助统计方法面对大规模数据集人工处理非常枯燥必须依赖计算机完成繁重工作以加速进程。这也是数据科学与机器学习发生交汇的地方——正如第一课所学机器学习就是构建模型以理解数据的过程而模型是数据中变量之间关系的表示可帮助预测结果。处理阶段常用的技术都在 ML for Beginners 课程体系中有完整覆盖本课给出了三类核心方法分类Classification将数据组织进不同类别以便更高效地使用。例如垃圾邮件识别、图像分类等场景聚类Clustering将数据划分到相似的分组中。聚类属于无监督学习用于在没有标签的情况下发现数据内在结构回归Regression确定变量之间的关系用于预测或预报数值型结果例如房价、销量预测。3.1 与分析阶段的关系需要区分的是生命周期中的处理与分析并不相同。分析阶段第 15 课更侧重于探索性数据分析EDA——用describe()做数据画像描述性统计、用sample()抽样、用query()查询、借助可视化发现缺失值与不一致数据从而确认数据能否支持建模。处理阶段则是真正执行模式发现与建模动作。两者的衔接点在于EDA 的产出特征定义、数据质量结论是进入建模前的必要输入。四、阶段三维护Maintenance回到生命周期图可以发现维护处于采集与处理之间它是管理、存储并保护数据的持续过程必须在项目的整个周期内持续考量而不是一个一次性动作。维护可细分为三个子主题数据存储、数据管理与数据安全。4.1 数据存储Storing Data数据存储如何存、存在哪的决策会同时影响存储成本与访问速度。这类决策通常不由数据科学家单独做出但他们需要根据数据的存储方式来选择自己的工作方式。影响决策的现代存储系统考量包括本地部署On-premisevs 离地部署Off-premisevs 公有云或私有云本地部署在自己的设备上托管与管理数据例如自建一台带硬盘的服务器存放数据离地部署依赖你不拥有的设备例如租用数据中心公有云当前非常流行的存储方式使用方无需关心数据具体存储在哪里、如何存储。公有意味着统一底层基础设施由所有云用户共享成本通常更低私有云一些组织有严格的安全策略要求对托管数据的设备拥有完全访问权因此使用自建的云服务。关于云上数据的进一步内容课程在 5-Data-Science-In-Cloud 章节中有专门三课展开为什么用云做数据科学、Low code/No code 方式、Azure ML SDK 方式。冷数据Coldvs 热数据Hot训练模型时你可能需要更多训练数据当模型令人满意后仍会有新数据不断流入供模型服务。无论哪种情况随着数据累积存储与访问成本都会上升。因此一种降低成本的做法是区分存储热数据频繁访问的数据放在高性能通常也更贵的存储介质上冷数据极少使用、长期归档的数据放在低成本的硬件或软件服务上需要访问冷数据时检索耗时通常比热数据更长。这种冷热分层tiering是控制数据基础设施成本的关键手段。4.2 数据管理Managing Data在数据使用过程中你可能会发现部分数据需要清洗才能构建准确的模型——这正是课程 数据准备data preparation 一课讨论的技术。当新数据不断到来时为保持质量一致性也需要反复应用同样的清洗流程。此外部分项目会在数据移动到最终位置前使用自动化工具完成清洗cleansing、聚合aggregation与压缩compressionAzure Data Factory就是这类工具的典型例子。4.3 数据安全Securing the Data数据安全的首要目标是确保所有参与数据处理的人都能控制采集了什么数据、在什么上下文中被使用。保持数据安全意味着只向需要的人开放访问、遵守当地法律法规并维持 伦理课程 中讨论的伦理标准。以安全为出发点团队可以做以下事情原文档完整保留确认所有数据都已加密encrypted向客户提供其数据被如何使用how their data is used的说明移除已离开项目成员的数据库访问权限只允许特定项目成员修改数据。五、ChallengeTDSP 与 CRISP-DM 框架对比数据科学生命周期存在许多版本各版本对阶段的命名与划分数量可能不同但本课提到的过程内核是一致的。本课的挑战任务要求你对比两种业界标准流程并指出二者的 3 个相同点与 3 个不同点微软团队数据科学过程Team Data Science Process, TDSP由微软提出的生命周期框架强调迭代式的数据科学项目执行跨行业数据挖掘标准过程CRISP-DM数据挖掘领域的经典流程标准包含业务理解、数据理解、数据准备、建模、评估、部署六个阶段。| 团队数据科学过程TDSP | 跨行业数据挖掘标准过程CRISP-DM | | -- | -- | ||| | 图片来自 Microsoft | 图片来自 Data Science Process Alliance |建议对比维度两个框架都强调问题/业务理解先行、都包含数据获取与准备环节、都需要建模与结果验证不同点在于 TDSP 更贴近微软云生态可衔接 Azure 服务CRISP-DM 更通用且显式包含业务理解与部署阶段TDSP 则把部署与运维生产环境纳入迭代循环。六、复习与自学生命周期中的角色与任务实际应用数据科学生命周期会涉及多种角色与任务不同角色可能专注于各阶段的特定环节。TDSP 提供了一些资源来解释项目中可能出现的角色类型与任务划分可作为自学材料团队数据科学过程的角色与任务Team Data Science Process roles and tasks执行数据科学任务探索、建模与部署Execute data science tasks: exploration, modeling, and deployment。七、课后作业评估一个数据集本课作业Assessing a Dataset要求你以数据科学家身份完成采集阶段的评估工作共三步评估data/taxi.csv这份数据能否回答纽约黄色出租车乘客在冬季还是夏季给司机的小费更多这一问题探索NYC Open Data 目录识别一个可能有助于回答客户问题的额外数据集写出 3 个需要向客户提出、以便更清楚理解问题的澄清问题。评估时建议结合上面的 Notebook 代码实际运行df pd.read_csv(path)后用df.describe()、df[payment_type].value_counts()、按月份分组统计tip_amount等操作可参考 第 15 课 的 EDA 方法系统性地判断数据数量与质量是否满足要求。评分标准分为 Exemplary示范级、Adequate合格、Needs Improvement需改进三档重点考察你是否能合理判断数据可用性并给出有依据的结论。八、总结数据科学生命周期把从数据到决策的复杂工作拆解为采集、处理、分析、沟通、维护五个阶段。本课重点强调采集阶段决定项目成败先定义可量化目标、再获取并评估数据是后续一切工作的前提处理阶段是数据科学与机器学习的交汇点分类、聚类、回归是三种最基础的建模技术维护阶段贯穿全程存储选型本地/离地/云、冷/热分层、数据管理与安全缺一不可TDSP 与 CRISP-DM 等框架提供了规范化流程参照但万变不离其宗。结合本仓库实际资源你可以通过 第 14 课 Notebook 亲手加载 taxi.csv 体验采集阶段的数据评估再通过 分析课 与 沟通课 走完生命周期的完整链路。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/9/11 1:30:03

微网优化调度与粒子群算法:需求响应下的源储荷协调策略

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/11 1:30:03

从收藏到掌握:信息过载时代的有效学习框架

1. 为什么收藏从未等于掌握?去年整理硬盘时,我发现自己有个命名为"学习资料"的文件夹,里面整整齐齐分类着137G的教程视频、462个PDF文档和上千条书签链接。这个发现让我突然意识到:这些年来我就像个知识松鼠&#xff0c…

2026/9/11 2:35:09

声振温监测方案拆解:从传感器选型到可视化看板落地

设备管理人员最怕的,从来不是“设备坏了”这件事本身,而是“不知道它快坏了”。传统模式下,转动设备就像一台关在铁皮柜子里的黑箱——巡检员拿听音棒贴上去听一听,用手背试一下壳体温度,再凭经验判断“还行”或者“有…

2026/9/11 2:35:09

2026年RFID技术演进:智能感知与边缘计算融合

1. RFID技术演进与产业升级背景2026年的RFID读写器将不再是简单的数据采集工具,而是演变为具备环境感知能力的智能终端。这种转变源于三个关键驱动力:首先,制造业对实时数据的需求从"有没有"升级为"准不准";其…

2026/9/11 2:35:09

CMSIS-5源码深度解析:架构、DSP/NN库与工程落地实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/10 16:39:38

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/10 11:16:38

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/9 16:31:09

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/10 12:32:02

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/10 15:19:50

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/10 15:49:53

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码