发布时间:2026/8/19 21:56:20
8. 理解 Dataset 理解 LLM 的数据加载流水线模型结构决定能力上限数据流水线决定训练效率和最终效果。在工业界大模型训练中花时间最多的往往不是模型而是数据。可以把整个训练过程想象成一家大型食品工厂原始数据 ↓ 清洗 ↓ 切块(Tokenize) ↓ 装箱(Padding) ↓ 打包(Batch) ↓ 送入模型 ↓ 计算Loss ↓ 反向传播一、数据是怎么进入模型的假设你有一条训练数据我喜欢学习人工智能模型根本看不懂中文。它只能看数字。所以第一步文本 ↓ Tokenizer ↓ Token ID例如我 喜 欢 学 习 人 工 智 能 ↓ [35, 88, 29, 63, 91, 17, 45, 73, 12]这时模型终于能处理了。二、Dataset仓库管理员Dataset 本质上就是告诉 PyTorch 去哪里拿数据。例如classMyDataset(Dataset):def__getitem__(self,idx):returnself.data[idx]def__len__(self):returnlen(self.data)作用数据文件 ↓ Dataset ↓ 一条一条样本像仓库管理员用户 给我第100条数据 Dataset 好的拿去例如dataset[0]返回{text:我喜欢AI}三、DataLoader流水线工人Dataset 一次只能取一个样本。训练时需要一次喂几十条 甚至几百条所以需要DataLoader负责Dataset ↓ 组装 Batch ↓ 送给 GPU例如loaderDataLoader(dataset,batch_size32,shuffleTrue)含义每次拿32条数据 随机打乱顺序 送入模型流程Dataset 样本1 样本2 样本3 ... 样本10000 ↓ DataLoader Batch1: 样本1~32 Batch2: 样本33~64 Batch3: 样本65~96四、为什么需要 Padding这是很多新人第一次接触训练时最困惑的地方。假设样本1: 我喜欢AI 长度4样本2: 今天天气不错 长度5样本3: 深度学习改变世界 长度8GPU 最喜欢矩形矩阵例如3 × 8而不是4 5 8这种参差不齐的长度。所以需要补齐。Padding 之前[我 喜 欢 AI] [今 天 天 气 不 错] [深 度 学 习 改 变 世 界]Padding 之后PAD 特殊填充符[我 喜 欢 AI PAD PAD PAD PAD] [今 天 天 气 不 错 PAD PAD] [深 度 学 习 改 变 世 界]这样长度统一8 8 8GPU 就能并行计算。五、为什么需要 Truncation有些文章特别长。例如长度 5000 Token而模型最大长度max_seq_len 2048怎么办只能砍掉。tokenstokens[:2048]变成前2048个保留 后2952个丢弃这就叫Truncation截断六、max_seq_len 到底是什么很多人误解max_seq_len 训练时随便设置的数字其实不是。它决定模型一次最多能看到多少Token例如max_seq_len 4096表示模型视野长度 ≈ 4096 Token类似人眼视野太短 看不见上下文 太长 显存爆炸因为 AttentionO(n2) O(n^2)O(n2)长度翻倍4096 → 8192 计算量 ≈ 4倍七、真正重要的Loss Mask这是 SFT 和预训练最大的区别之一。很多面试都会问。预训练数据我 喜 欢 学 习 AI训练目标预测下一个词例如我 → 喜 我 喜 → 欢 我 喜 欢 → 学因此每个Token都有价值Loss Mask[1 1 1 1 1]除了 PAD[1 1 1 1 1 0 0]SFT 为什么不同假设训练样本User: 什么是AI Assistant: AI是人工智能。拼接后User 什么是AI Assistant AI是人工智能。模型输入全部输入进去但是监督目标不是全部。我们只关心什么只关心Assistant 怎么回答不关心User 怎么提问所以User部分 不计算LossLoss MaskUser 什么是AI Assistant AI是人工智能。对应0 0 0 0 0 0 1 1 1 1 1 1图示Prompt ↓↓↓↓↓↓↓ 什么是AI 000000000 Assistant回答 ↓↓↓↓↓↓↓ AI是人工智能 111111111为什么必须这样做假设不 Mask。模型会同时学习如何提问 如何回答梯度目标混在一起。结果可能变成用户什么是AI 模型 什么是AI因为模型发现训练数据里 用户说的话也算Loss于是它会模仿用户。这显然不是我们想要的。八、Loss 是怎么计算的假设Loss [2.1, 1.5, 3.0, 0.8]对应 Mask[0, 0, 1, 1]那么实际计算0×2.1 0×1.5 1×3.0 1×0.8只保留3.0 0.8最后平均(3.0 0.8) / 2九、Batch Size 是什么假设10万条训练数据不可能一次全塞GPU所以分批例如batch_size 32表示一次训练32条数据流程Batch1 → 更新参数 Batch2 → 更新参数 Batch3 → 更新参数十、为什么还要梯度累积假设你希望batch_size 256训练更稳定。但是显存只能放32怎么办拆开。原本256条 一起算变成32 32 32 32 32 32 32 32共8次每次loss.backward()只累计梯度。不更新参数。最后一次optimizer.step()更新一次。效果近似真正 batch_size256公式Effective Batch Sizebatch size×gradient accumulation×GPU 数 \text{Effective Batch Size} \text{batch size} \times \text{gradient accumulation} \times \text{GPU 数}Effective Batch Sizebatch size×gradient accumulation×GPU数例如batch_size 32 grad_acc 8 gpu 4则有效Batch 32 × 8 × 4 1024十一、完整训练流水线把所有东西串起来如果只记住一句话Dataset 负责“取数据”Tokenizer 负责“切词变数字”Padding 负责“补齐长度”Loss Mask 负责“告诉模型哪些地方该学习”DataLoader 负责“打包成 Batch 送进 GPU”。这五个环节组成了 LLM 训练的数据处理流水线。

相关新闻

2026/8/19 21:56:20

9. 理解 Tokenizer

什么是 Tokenizer(分词器)? 如果只用一句话解释: Tokenizer 就是大模型和人类语言之间的翻译器。 它负责把文本变成数字(Token ID),再把数字还原成文本。 因为神经网络根本不认识: …

2026/8/19 21:51:20

RT-Thread消息队列实战:从轮询到高效线程通信的设计模式

1. 从“轮询”到“消息”:为什么我们需要消息队列 在嵌入式开发,尤其是RT-Thread这类实时操作系统的应用里,线程(或任务)间的通信是一个绕不开的核心话题。很多初学者,包括我自己刚入门时,最容易…

2026/8/19 23:01:36

基于Arduino与RC522的RFID门禁系统DIY:从原理到智能工具柜实战

1. 项目概述:当RFID遇上DIY,无限创意由此开启 如果你手头有几张闲置的门禁卡、公交卡,或者对超市里“嘀”一下就能结账的标签感到好奇,那么“DIY Idea with RFID”这个主题绝对能为你打开一扇新世界的大门。RFID,也就是…

2026/8/19 23:01:36

DIY绿色激光夜空目标指向器:天文观测的精准寻星方案

1. 项目概述:当星空观测遇上绿色激光对于每一位天文爱好者来说,在浩瀚的星海中快速定位一个暗淡的深空天体,比如M31仙女座大星系或者M42猎户座大星云,从来都不是一件容易的事。传统的寻星镜视野狭窄,红点寻星镜在完全黑…

2026/8/19 22:56:36

从电路原理到派对神器:Hot Wire游戏制作全解析

1. 项目概述:从“热导线”到派对游戏的奇妙旅程“Hot wire”这个词,乍一听像是某个电子实验室里的专业术语,或者汽车维修手册里关于点火线路的章节。但如果你把它和“派对游戏”放在一起,味道就完全变了。这正是这个标题最吸引人的…

2026/8/19 4:14:28

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/19 15:09:57

工业传感器与变送器详解:序章 从物理世界到工业数据

序章 从物理世界到工业数据 ——重新认识工业传感器与变送器 工业自动化系统正变得日益复杂。今天的工业现场早已不是简单的控制回路,而是由多层技术共同构成的立体体系:PLC、DCS、SCADA、MES、工业互联网、边缘计算与人工智能。控制系统可以执行复杂算法,工业网络可以实现…

2026/8/19 0:00:35

【单片机课程设计/毕业设计】基于 STM32 与 WiFi 模块的室内通风智能管控系统设计 基于 STM32 的人体存在感知自适应风扇控制系统设计(018503)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于嵌入式单片机,Java、小程序技术领域和毕业项目实战 ✌️…

2026/8/19 0:00:35

AI如何驱动数学猜想生成:从大语言模型到自动化数学发现

1. 项目概述:当AI开始“猜”数学定理 最近在AI研究圈里,一个名为“Moonshine”的项目引起了不小的讨论。这名字本身就挺有意思,直译是“月光”,但在数学史上,它特指一个神秘而美丽的联系——魔群月光猜想,连…

2026/8/19 0:00:36

Agentic Web:构建智能体原生网络的基础设施挑战与四大支柱

1. 从“被动网络”到“能动网络”:一个正在发生的范式转移 如果你最近关注AI和Web技术的前沿动态,可能会频繁听到“Agentic Web”这个词。它不像“Web3”那样带着浓厚的金融色彩,也不像“元宇宙”那样充满科幻感,但它所描绘的未来…

2026/8/18 18:23:10

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/19 4:14:38

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/19 16:39:34

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…