发布时间:2026/7/23 21:57:35
预训练+微调的训练范式 语言模型训练范式一、常见的训练阶段划分LLM都是怎么训练出来的以GPT为例1.pretrain2.SFT3.reward model4.PPOPretrainpretrain预训练内里包含大量的数学公式。不停的阅读大量资料然后学习如何使用文字。需要最大的数据量消耗最大的显卡算力。m百万b十亿t万亿eg. llama 3 使用了15t tokensllama 4 Scout使用了40t tokens大语言模型输出的每一话都需要学习人类语言后逐字表达计算下一个字在人类语言规范中的可能性然后结合训练和语境给出他的答案。本质上是一个续写的工具最初什么都不会怎么学呢这个时候逐字表达等于瞎蒙给他参考数据。段落联合概率让一个模型能一字不落的生成整个段落的概率。将所有的段落联合概率相乘已知第一个字求第二个字相匹配的概率、已知前两个字求第三个字相匹配的概率、已知前三个字求第四个字相匹配的概率.......依次相乘让模型学习人类的表达方式。对每一条数据得出的段落联合概率可以看出模型对人类语言和知识的掌握程度。不同的段落联合概率按照不同的要求调整LLM从而整体提升段落联合概率让他们达到一个可观的值 。SFT预训练模型说话像接话茬而不是在做任务希望做什么类型的任务就用什么样的数据做指令微调instruction tuning。SFT有监督的微调训练有监督使用有标签的数据进行训练学习过程叫做有监督学习。标签包括对文字的正负向判断、相似程度判断、排序等。使用无标签的数据进行训练学习过程叫做无监督学习。pretrain叫自监督自己进行训练pretrainSFT两个阶段组合起来就叫半监督不缺数据但缺标签、需要人工标注llama 3使用了15t tokensSFT阶段使用的数据量大概只有几十万条为预训练阶段的五千分之一数据量普遍不大。Reward Modelreward model训练一个奖励模型在旁边当教练。评估是一个很难的事情评估一个模型的整体能力评估一个问题回答的如何。如何判断大模型干的好不好需要我们事先训练一个教练进行打分。1、准备一系列prompt让模型给每个prompt生成多个response(几万到几十万2、设计一下如何标注打分、评级、排序3、招一批人来做标注工作训练出一个教练员。PPO强化学习PPO用上一步的教练模型对工作进行优化当优化趋于饱和之后再重新训练一个教练重复这两个步骤直到都难以取得进展。reward model和PPO不断循环的过程就是强化学习的过程叫做RLHF“对齐”给予人类反馈的强化学习。纯粹课程笔记。

相关新闻

2026/7/23 21:57:35

2026南昌企业工商变更实操解析(附全流程步骤)

2026南昌企业工商变更实操解析(附全流程步骤)发布日期:2026年7月在企业日常运营中,工商变更属于高频操作,而南昌地区因数据共享机制的全面落地,变更流程与审核标准较往年有明显调整。本文结合2026年南昌最新…

2026/7/23 21:57:35

2026年图数据库选型:Arango凭什么成为多模型领域首选?

引言:图数据库市场的新格局 2026 年,图数据库已经从"小众技术"成长为数据基础设施的核心组件。知识图谱、推荐系统、欺诈检测、供应链分析、AI 语义检索——这些场景的背后都离不开图数据模型的支撑。然而,当企业真正进入选型阶段时…

2026/7/23 23:28:07

【RT-DETR涨点改进】CVPR 2026顶会| 独家卷积+Mamba改进篇| 引入AKCMamba-YOLO中的CAKCMamba模块,助力小目标检测、遥感目标检测任务,高效涨点

一、本文介绍 🔥本文给大家介绍使用 引入AKCMamba-YOLO中的CAKCMamba模块 改进RT-DETR网络模型,CAKCMamba 通过 AKConv/CAKC 自适应调整卷积采样位置,增强对不同尺度、不同形状和不规则目标的局部感知能力;再利用 AKSS2D/Mamba 状态空间模型沿二维空间方向建模长距离依赖…

2026/7/23 23:28:07

请假流程:六款.NET工作流引擎实现方式对比

请假请流程:六款.NET工作流引擎实现方式对比对象:Elsa Workflows、Workflow Core、WorkflowEngine.NET、CCFlow、StepWise、Slickflow 对照需求:一份「人人可发起」的简单请假审批(含天数分支、表单附件、反馈申请人) …

2026/7/23 23:28:07

【从0开发一个 Agent】第十章:Prompt Engineering 工程化

在前面的章节中,我们已经为 AI Agent 赋予了工具调用、长期记忆和 RAG 知识库等强大能力。但你是否发现,随着功能模块的堆叠,System Prompt 变得越来越臃肿,Agent 的行为也开始变得不稳定?有时它会忘记 RAG 的约束&…

2026/7/23 23:23:07

Claude Code被曝重大隐患,揭开了算法安全的帷幕

目录一、Claude Code很厉害,但是要小心二、如何验证算法的安全性?三、番瓜AI多模态生成算法四、江苏迅高智能科技一、Claude Code很厉害,但是要小心 Claude Code (简称CC) 就是全球第一的AI编程 Agent。我想现在很多人都会认可这句话&#x…

2026/7/23 12:54:51

Unity与Python本地通信:基于Flask的跨语言数据交换实战

1. 项目概述:为什么我们需要一个本地通信服务器?在游戏开发、数字孪生、仿真训练等众多领域,Unity作为强大的实时3D内容创作平台,其核心逻辑通常由C#驱动。然而,当我们需要进行复杂的数据分析、机器学习推理、科学计算…

2026/7/23 0:01:10

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/22 21:00:12

3个高效策略:快速掌握Axure中文界面配置

3个高效策略:快速掌握Axure中文界面配置 【免费下载链接】axure-cn Chinese language file for Axure RP. Axure RP 简体中文语言包。支持 Axure 11、10、9。不定期更新。 项目地址: https://gitcode.com/gh_mirrors/ax/axure-cn 还在为Axure RP的英文界面感…