预训练+微调的训练范式

发布时间:2026/9/11 10:49:43

预训练+微调的训练范式 语言模型训练范式一、常见的训练阶段划分LLM都是怎么训练出来的以GPT为例1.pretrain2.SFT3.reward model4.PPOPretrainpretrain预训练内里包含大量的数学公式。不停的阅读大量资料然后学习如何使用文字。需要最大的数据量消耗最大的显卡算力。m百万b十亿t万亿eg. llama 3 使用了15t tokensllama 4 Scout使用了40t tokens大语言模型输出的每一话都需要学习人类语言后逐字表达计算下一个字在人类语言规范中的可能性然后结合训练和语境给出他的答案。本质上是一个续写的工具最初什么都不会怎么学呢这个时候逐字表达等于瞎蒙给他参考数据。段落联合概率让一个模型能一字不落的生成整个段落的概率。将所有的段落联合概率相乘已知第一个字求第二个字相匹配的概率、已知前两个字求第三个字相匹配的概率、已知前三个字求第四个字相匹配的概率.......依次相乘让模型学习人类的表达方式。对每一条数据得出的段落联合概率可以看出模型对人类语言和知识的掌握程度。不同的段落联合概率按照不同的要求调整LLM从而整体提升段落联合概率让他们达到一个可观的值 。SFT预训练模型说话像接话茬而不是在做任务希望做什么类型的任务就用什么样的数据做指令微调instruction tuning。SFT有监督的微调训练有监督使用有标签的数据进行训练学习过程叫做有监督学习。标签包括对文字的正负向判断、相似程度判断、排序等。使用无标签的数据进行训练学习过程叫做无监督学习。pretrain叫自监督自己进行训练pretrainSFT两个阶段组合起来就叫半监督不缺数据但缺标签、需要人工标注llama 3使用了15t tokensSFT阶段使用的数据量大概只有几十万条为预训练阶段的五千分之一数据量普遍不大。Reward Modelreward model训练一个奖励模型在旁边当教练。评估是一个很难的事情评估一个模型的整体能力评估一个问题回答的如何。如何判断大模型干的好不好需要我们事先训练一个教练进行打分。1、准备一系列prompt让模型给每个prompt生成多个response(几万到几十万2、设计一下如何标注打分、评级、排序3、招一批人来做标注工作训练出一个教练员。PPO强化学习PPO用上一步的教练模型对工作进行优化当优化趋于饱和之后再重新训练一个教练重复这两个步骤直到都难以取得进展。reward model和PPO不断循环的过程就是强化学习的过程叫做RLHF“对齐”给予人类反馈的强化学习。纯粹课程笔记。
延伸阅读

更多相关文章

2026/9/12 6:00:10

2026南昌企业工商变更实操解析(附全流程步骤)

2026南昌企业工商变更实操解析(附全流程步骤)发布日期:2026年7月在企业日常运营中,工商变更属于高频操作,而南昌地区因数据共享机制的全面落地,变更流程与审核标准较往年有明显调整。本文结合2026年南昌最新…

2026/9/1 4:19:37

2026年图数据库选型:Arango凭什么成为多模型领域首选?

引言:图数据库市场的新格局 2026 年,图数据库已经从"小众技术"成长为数据基础设施的核心组件。知识图谱、推荐系统、欺诈检测、供应链分析、AI 语义检索——这些场景的背后都离不开图数据模型的支撑。然而,当企业真正进入选型阶段时…

2026/9/12 5:59:56

警惕技术名词虚构:如何识别并验证开源项目真实性

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/12 2:05:33

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/12 3:55:12

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/9 16:31:09

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/12 0:04:17

MATLAB仿生优化框架:长鼻浣熊算法多策略融合实现

简介:本资源是一份面向智能优化算法研究者与MATLAB初学者的仿生智能算法实践代码包,聚焦于长鼻浣熊优化算法(COA)的多策略改进与性能验证。针对传统COA易陷局部最优、收敛精度不足等问题,作者融合Circle映射初始化提升…

2026/9/12 0:04:17

【JAVA毕设源码分享】基于 JavaWeb 的校园一卡通管理系统的设计与实现 基于 JavaWeb 的校园卡业务管理系统(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/9/12 0:04:17

【JAVA毕设源码分享】基于 Java 的图书馆借阅管理平台的搭建与实现 基于 Java 的图书馆综合管理系统(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/9/10 12:32:02

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/10 15:19:50

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/10 15:49:53

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码