SFT、RLHF、LoRA:微调的真相其实没那么复杂

发布时间:2026/9/8 6:06:43

SFT、RLHF、LoRA:微调的真相其实没那么复杂 最近接触了不少做微调的朋友发现大家对微调到底是什么这个问题的理解差异很大。有人觉得是炼丹有人觉得是工程也有人觉得两者都是。写这篇的目的是把自己理解的微调脉络理清楚也给刚开始接触的人一个参考。微调解决的是什么问题很多人以为微调是在教模型“新知识”但实际情况完全不是。预训练模型的能力很强这是公认的。但它有一个天然局限——它是通用的。你让它写代码、做翻译、总结文章都没问题但一旦涉及你公司内部的格式规范、业务流程、行业术语它就开始自由发挥了。这不是模型的错是预训练阶段根本没接触过这些内容。微调做的事情就是在预训练模型已有的通用能力之上注入特定领域的知识和规则。模型还是那个模型参数没变多少但它开始按你的规矩办事了。微调的标准流程目前业界比较成熟的微调方案大致包含三个阶段。第一阶段SFTSFT 全称是 Supervised Fine-Tuning有监督微调。做法很简单——准备一批高质量的问答对让模型照着学。比如你给模型看这样的数据输入请帮我写一个请假条期望输出好的以下是您的请假条模板……模型在这个过程中学到的不是新知识而是一种行为模式用户提出某个请求时我应该用什么样的格式和语气来回应。这个阶段数据质量是第一优先级。十个劣质样本不如一个优质样本因为模型在模仿你的数据分布你喂给它什么风格它就学会什么风格。所以微调本质上不是教模型“会不会”而是教它“怎么回答”。第二阶段奖励模型SFT 解决的是模型知道该怎么回答但还没解决模型知道什么叫答得好。奖励模型Reward Model简称 RM就是用来解决这个问题的。它的训练方式和普通大模型不同——它不生成文本而是对两个回答做打分比较。你给它一组数据同一个问题下的两个回答以及人类标注员认为更好的那个。反复训练之后RM 就具备了评判回答质量的能力。可以把它理解为一个裁判专门负责给模型的输出打分。第三阶段对齐有了裁判之后下一步就是让模型根据裁判的反馈来调整自己。这一步有两种主流做法RLHF 和 DPO。RLHF基于人类反馈的强化学习的流程相对复杂模型生成回答 → 裁判打分 → 根据分数反向更新模型参数。DPO直接偏好优化则简化了这个过程把奖励模型的学习直接整合到了微调目标函数里省去了单独的 RL 训练阶段。两种方式效果接近DPO 因为实现更简单近年来使用越来越广泛。不管选哪种目的都一样让模型的回答更安全、更符合人类预期减少胡说八道的情况。参数微调的策略全参数微调理论上效果最好但代价也最大。一个 70B 的模型全量微调显存需求是普通显卡承受不了的。而且全量更新还有一个副作用——模型可能在新任务上表现不错但把预训练阶段的通用能力给覆盖了这就是常说的灾难性遗忘。为了解决这些问题出现了不少高效微调方案。LoRALoRALow-Rank Adaptation的思路很简洁不在原始参数上做加法而是并行加一小块。具体来说它在每一层网络旁边挂一个低秩矩阵训练的时候只更新这两个小矩阵原始参数完全冻结。推理阶段训练好的低秩矩阵可以直接叠加回原始参数不增加任何延迟。显存需求从几百 GB 降到十几 GB这也是 LoRA 能快速普及的主要原因。QLoRAQLoRA 在 LoRA 的基础上又往前了一步——先把预训练模型量化到 4bit再做 LoRA 微调。4bit 意味着参数量只有原来的四分之一显存压力大幅降低。虽然精度有损失但在大多数下游任务上效果差别不大。实践中容易遇到的问题数据质量这是最容易被低估的一环。很多项目效果不理想回头一看数据质量参差不齐。模型不会自动区分好坏数据它只会忠实地拟合训练集中的每一个模式。如果训练集里混杂了大量低质样本模型学到的就是混乱的行为。解决思路是用更强的模型先去清洗数据过滤掉格式错误、内容不完整、标注不一致的样本。这一步多花的时间后面能省回来。过拟合过拟合的表现是训练集上效果很好验证集上指标下滑。缓解手段有两个早停验证集指标不再提升时停止训练和权重衰减给损失函数加一个正则化项限制参数更新幅度。这两个都是经典方法不算新技术但对控制过拟合确实有效。显存不足显存不够的时候可以从几个方向入手用 QLoRA 降低基础开销开启梯度检查点用计算换显存设置梯度累加模拟更大的 batch size。通常组合使用效果最好。数据配比做了微调之后发现模型在某些通用能力上退化了这时候可以考虑在训练数据里混入一部分通用语料保持模型的基础语言能力不被覆盖。数据混合的比例需要根据具体任务调试没有固定公式。微调这件事拆开了看其实并不神秘。SFT 教格式RM 立标准对齐做收敛LoRA 降门槛。每个环节都有明确的分工也有成熟的工具链支持。真正难的是数据准备和超参调试这部分没有捷径只能一遍遍试。但好消息是随着 QLoRA 这类方案的普及试错的边际成本已经低了很多。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
延伸阅读

更多相关文章

2026/9/6 17:22:48

LangChain 高阶模式:Multi-agent —— 多 Agent 协作

本文是 LangChain「高阶模式」系列的第 1 篇。在走完基础概念、工具调用、输出交互之后,我们开始进入更复杂的编排领域——让多个 Agent 协作完成单个 Agent 难以胜任的任务。 一、概念:什么是 Multi-agent? Multi-agent(多 Agen…

2026/9/7 18:41:01

Prolog声明式编程原理与实战:从家族推理到医疗规则引擎

1. 项目概述:为什么一个40岁的老语言,今天还在被AI工程师悄悄用着“Logic will get you from A to B. Imagination will take you everywhere.”——爱因斯坦这句话,放在Prolog身上,简直像量身定做的注脚。不是因为它多炫酷&#…

2026/9/8 15:58:56

嵌入式场景下AI生成代码的验证体系:从静态分析到形式化验证

代码生成越来越容易,真正困难的是验证 | 嵌入式场景下 AI 生成代码的验证体系先从我的个人感受说起。过去一年里,我用 AI 辅助生成了大量嵌入式 C 代码,从 MCU 外设驱动到通信协议栈,再到状态机框架,只要提示词写得足够…

2026/9/8 15:58:56

FastAPI+Milvus+RAG:构建汽修知识库问答与工单闭环系统

修车行最值钱的资产,从来不是举升机和诊断电脑,而是老师傅脑子里那套判断逻辑。同一句“发动机抖动”,国六新车和十年前的电喷车,排查路径能差出十万八千里。我在做汽修门店数字化系统时,最头疼的就是怎么把这套经验从…

2026/9/8 15:58:56

瞳孔虹膜检测数据集详解:从VOC/YOLO格式到YOLOv8训练实战

简介:面向计算机视觉目标检测方向的开发者与学习者,这份瞳孔虹膜检测数据集专注于眼部关键结构识别,可用于训练瞳孔与虹膜定位模型。数据采用Pascal VOC与YOLO两种主流标注格式,并配有完整的矩形框标注信息,可直接接入…

2026/9/8 15:58:56

什么是哈希函数?它有什么作用?

哈希函数是什么?哈希函数就像一个神奇的机器,它可以把任何信息(比如文字、数字、图片等)转换成一个固定长度的代码,这个代码叫做“哈希值”或“散列值”。这个转换是单向的,也就是说,从这个哈希…

2026/9/8 15:58:56

从Copilot到自主编程Agent:AI编程进化与开发者新技能

如果你干这行够久,应该还记得GitHub Copilot刚发布那会儿的争论。有人说这是程序员的末日,有人说这不过是加强版自动补全,两边吵得不可开交。我当时的判断是后者——一个在括号里蹦跶的代码建议工具,能掀起什么浪?后来…

2026/9/8 7:15:10

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/8 7:15:15

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/8 7:15:10

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/8 0:01:49

踩多轮坑才跑通|OpenClaw 3.1.0 双平台本地 AI 自动化搭建实操实录

🔹 工具简述 OpenClaw 是一款备受开发者与办公人群青睐的开源本地智能工具,凭借离线本地运行、可视化图形面板、全流程自主任务处理三大核心特点,积累了众多忠实用户。与普通对话类 AI 产品不同,它能够直接调用电脑的软硬件操作权…

2026/9/8 0:01:50

拒绝复杂命令行,Hermes Agent 一键包快速解锁智能办公能力

🔍前言 不少想要体验 Hermes Agent 办公能力的使用者,往往会被复杂的环境配置拦住使用脚步。手动下载匹配依赖、反复调整系统目录、处理命令行持续报错、修复权限异常、补全丢失核心文件等一系列操作,对普通使用者而言门槛较高,很…

2026/9/7 16:23:03

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/7 22:46:00

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/7 22:45:59

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码