发布时间:2026/8/22 19:50:59
LlamaFactory 微调提速实战:3 行配置解锁 Liger Kernel 加速与 ZeRO-3 省显存完整指南 LlamaFactory 微调提速实战3 行配置解锁 Liger Kernel 加速与 ZeRO-3 省显存完整指南【免费下载链接】LlamaFactoryUnified Efficient Fine-Tuning of 100 LLMs VLMs (ACL 2024)项目地址: https://gitcode.com/GitHub_Trending/ll/LlamaFactory你上一次微调大模型是不是也卡在 32GB 显卡上跑 7B 模型只能 batch_size1、一个 epoch 磨几个小时稍微放大 batch 就收到 OOM 报错本文主角 LlamaFactory 是一个支持 100 文本与视觉语言模型统一微调的开源框架ACL 2024它把 Liger Kernel 融合算子、选择性梯度检查点、ZeRO-3 显存分片三件事做成了开箱即用的一等公民配置——你只需要改几行 YAML。据 Liger Kernel 官方在 H100 上对 Llama-7B 的公开测试融合算子可带来约 2 倍的训练吞吐量配合 ZeRO-3 CPU offload单卡 24GB 显存全参微调 7B 模型从不可能变成能跑。读完本文你能拿到一套可直接复制的配置、一份自测脚本和三个最常见的坑。方案对比三件优化分别换来了什么先说结论这三项优化分别解决算得快、存得下、跑得动三个不同问题互不冲突推荐按组合使用。下面是收益对照测试口径Qwen 系 7B 量级模型、bf16、batch_size4、序列长度 2048数据取自本文作者 A100 单卡实测与 Liger Kernel 官方基准你可以用仓库里的脚本在自己的机器上复测优化项你要做什么换来的收益收益口径Liger Kernel 融合算子装 1 个包 配置里加 1 行吞吐约 2 倍交叉熵分块化后显存峰值下降logits 矩阵不再整体驻留显存Liger Kernel 官方 H100/Llama-7B 基准选择性梯度检查点默认开启无需额外配置LoRA 场景激活显存较全层检查点减少约 1/3本文作者 A100 实测n3 次运行均值ZeRO-3 CPU offload指定 1 个 JSON 配置文件全参微调显存较 ZeRO-0 下降约 55%代价是训练步时增加 20%~40%本文作者 A100 实测n3 次运行均值核心机制拆解它是怎么起效的三个机制都是用时间换空间或用融合换访存下面用大白话讲清楚。用 Liger Kernel 融合算子换吞吐与显存标准 Transformer 前向过程由大量小算子串成LayerNorm、RoPE、SwiGLU、交叉熵……每个算子都要从全局显存读一遍数据、写一遍中间结果GPU 在搬数上空转的比例很高。Liger Kernel 把这些算子重写成单个融合 kernel其中对显存影响最大的是交叉熵标准实现要先算出 [序列长度, 词表大小] 的 logits 矩阵再求 loss序列 2048、词表 15 万时这一个矩阵就是 1GB 出头Liger 的分块交叉熵按块计算 losslogits 从始至终不整体驻留显存。这正是快 2 倍 省显存两个数字的共同来源。LlamaFactory 在 src/llamafactory/model/model_utils/liger_kernel.py 中按模型类型自动分发目前覆盖 llama、qwen2/qwen2_vl/qwen3、gemma 系列、glm4、mistral、mixtral、mllama 等 20 架构。用选择性梯度检查点省激活显存梯度检查点的思路是前向时不存激活值反向时重算一遍重算约花 30% 的额外计算时间但能砍掉大头激活显存。问题是全层无差别检查点太浪费LoRA 微调时大多数层根本不可训练它们的激活值反向时用不上。src/llamafactory/model/model_utils/checkpointing.py 里的get_custom_gradient_checkpointing_func会检查每层参数是否requires_grad只有可训练层套上 checkpoint 包装冻结层直接前向执行——这就是同样开检查点LoRA 比全参省 1/3 显存的来由。它还内置了 Unsloth 风格的 CPU offload 变体use_unsloth_gc把要重算的隐藏态非阻塞地挪到内存再极端一点也能撑住。用 ZeRO-3 加 CPU offload 把大模型塞进小显存全参微调 7B 模型仅优化器状态就要约 56GB 显存Adam 需要 fp32 主权重加动量、方差两份拷贝。ZeRO-3 把参数、梯度、优化器状态三样都切分到所有 GPU 上每张卡只持有 1/N再把offload_param/offload_optimizer指向 CPU 后连这 1/N 都可以挪到内存里GPU 只在计算当前层时临时取用。配置就在 examples/deepspeed/ds_z3_config.json 与带 offload 的 examples/deepspeed/ds_z3_offload_config.json前者适合多卡 GPU 互切、显存仍紧张的场景后者适合单卡能跑就行的场景。上手拆解从克隆到跑通的四步操作第 1 步目标拿到可运行的代码环境。操作git clone https://gitcode.com/GitHub_Trending/ll/LlamaFactory进入目录后执行pip install -e .。预期结果python -c import llamafactory无报错。第 2 步目标装上 Liger Kernel 依赖。操作执行pip install -r requirements/liger-kernel.txt要求 liger-kernel0.6.3。预期结果pip show liger-kernel能看到版本号。第 3 步目标写一份带全部优化的训练配置。操作复制 examples/train_lora/qwen3_lora_sft.yaml加入下面 3 行。enable_liger_kernel: true bf16: true deepspeed: examples/deepspeed/ds_z3_config.json预期结果配置通过参数校验enable_liger_kernel默认是 false不加这行优化不会生效。第 4 步目标启动训练并确认优化生效。操作llamafactory-cli train examples/train_lora/qwen3_lora_sft.yaml多卡用deepspeed --num_gpusN或 accelerate 启动。预期结果日志出现Liger kernel has been applied to the model.训练步时与显存占用对比未加配置时下降之前 OOM 的 batch_size 现在能跑。避坑与验证先确认生效再谈收益坑一模型架构不在支持列表里优化静默失效。不支持的架构只会打一条Current model does not support liger kernel.警告然后照常训练速度不会变快但也不会报错。验证方法训练启动后 grep 日志没看到Liger kernel has been applied就说明没生效去 src/llamafactory/model/model_utils/liger_kernel.py 里查你的 model_type 是否在列表中。坑二DPO / 奖励模型 / KTO 阶段拿不到分块交叉熵的加速。这些阶段需要完整 logits 输出代码会自动关闭fused_linear_cross_entropy并打印Current training stage does not support chunked cross entropy.——此时你还能省一部分显存但别期待 2 倍吞吐那是 SFT/PT 阶段的收益。坑三NPU 与旧版本 liger-kernel 的兼容性。非 Ascend 910 的 NPU 上会自动关闭 SwiGLU 融合与分块交叉熵日志可见对应分支gpt_oss 等较新架构如果报 ImportError说明装的 liger-kernel 版本太旧升到 0.6.3 以上再试。验证是否真的生效最省事的方式是跑仓库自带的多模态基准 scripts/bench_qwen.pypython scripts/bench_qwen.py --liger_kernel False与--liger_kernel True各跑一次直接对比 token/吞吐与显存峰值。收尾把这篇东西落地就一句话装包、加 3 行配置、看日志确认换来约 2 倍吞吐和肉眼可见的显存下降。团队还在持续扩充 Liger Kernel 支持的架构清单qwen3_moe、qwen3_next 这些新模型都已跟进新模型适配也在路上。别再让 GPU 空转现在就 clone 下来跑一遍 bench用你自己显卡上的数字说话。【免费下载链接】LlamaFactoryUnified Efficient Fine-Tuning of 100 LLMs VLMs (ACL 2024)项目地址: https://gitcode.com/GitHub_Trending/ll/LlamaFactory创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/8/22 19:45:58

数学建模竞赛微分方程应用指南:从模型构建到求解实现

1. 项目概述:微分方程,数学建模的“通用语言”在数学建模竞赛的赛场上,无论是国赛、美赛还是各类地区性赛事,你几乎找不到一个完全用不上微分方程的题目。它就像一种“通用语言”,能够描述从物理世界到社会科学的广泛动…

2026/8/22 19:45:58

美赛数学建模算法决策地图:回归/灰色/马尔科夫/BP模型实战选型指南

1. 这不是“模型清单”,而是美赛实战中的算法决策地图2024美赛数学建模赛题解读常用模型算法——这句话乍看像一份复习提纲,但实际是参赛队伍在4天96小时内能否把问题拆解清楚、把结果讲得服人、把论文写得有说服力的底层操作系统。我带过7届美赛队伍&am…

2026/8/22 19:45:58

macdowsOS Tool UI 1.30:一键为Windows披上macOS外衣的自动化美化工具

如果你想让 Windows 系统拥有 macOS 的视觉体验和操作习惯,但又不想折腾复杂的系统美化或虚拟机,那么今天这个工具值得你花 5 分钟了解一下。macdowsOS Tool UI 是一个专为 Windows 设计的全自动仿 macOS 界面工具,最新版本是 1.30。它的核心…

2026/8/22 21:06:04

光分路器插入损耗深度解析:理论值、工艺损耗与实测偏差

1. 光分路器衰减不是“固定值”,而是设计参数与物理现实的博弈光分路器——这个在光纤入户、5G前传、数据中心光互联里天天打交道却很少被真正看懂的“黑盒子”,它的光衰从来就不是出厂贴个标签写个“3dB”就完事那么简单。我干光通信现场交付和测试十年…

2026/8/22 21:06:04

网络工程师成长指南:从TCP/IP到自动化运维的实战路径

1. 从“拉网线”到“定乾坤”:网络工程师的现代画像提到网络工程师,很多人的第一印象可能还停留在“拉网线”、“配交换机”的机房运维人员。如果你也这么想,那可能就错过了这个职业在数字化浪潮中的核心价值。我入行十几年,亲眼见…

2026/8/22 21:06:04

5 分钟搞定 ncmdump:NCM 转 MP3/FLAC 的本地解密完整指南

5 分钟搞定 ncmdump:NCM 转 MP3/FLAC 的本地解密完整指南 【免费下载链接】ncmdump ncmdump - 网易云音乐NCM转换 项目地址: https://gitcode.com/gh_mirrors/ncmdu/ncmdump ncmdump 是一款本地运行的 NCM 转换工具,用于网易云音乐 NCM 解密&…

2026/8/22 21:06:04

Linux命令-wget(非交互式网络下载工具)

Linux命令-wget(非交互式网络下载工具)语法常用选项基础用法1. 基本下载2. 断点续传和重试3. 限速下载4. 批量下载5. 递归下载(镜像网站)6. FTP 下载7. 实用脚本示例8. wget 与 curl 对比wget(GNU Wget)是非…

2026/8/22 21:06:04

Windows 0xC00000D4错误根源与精准修复指南

1. 这个错误不是“启动慢”,而是系统在关机时就已埋下雷你有没有遇到过这样的场景:早上按下电源键,Windows图标刚亮起,进度条走到一半突然卡住,几秒后黑屏重启,或者干脆停在LOGO界面不动——等你进系统一看…

2026/8/22 21:01:04

C++模板高阶应用:从编译期计算到完美转发的实战指南

1. 从“能用”到“敢用”:C模板高阶应用的现实意义干了这么多年C,我发现一个挺有意思的现象:很多朋友对模板的态度,基本就停留在“哦,知道,STL里那些vector、map就是模板”。面试的时候,也能把函…

2026/8/21 13:13:49

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/21 20:14:07

工业传感器与变送器详解:序章 从物理世界到工业数据

序章 从物理世界到工业数据 ——重新认识工业传感器与变送器 工业自动化系统正变得日益复杂。今天的工业现场早已不是简单的控制回路,而是由多层技术共同构成的立体体系:PLC、DCS、SCADA、MES、工业互联网、边缘计算与人工智能。控制系统可以执行复杂算法,工业网络可以实现…

2026/8/21 15:40:01

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/21 15:40:01

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/22 1:39:53

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…