如何把 LoRA 权重合并进基础模型:swift 模型合并完整指南

发布时间:2026/9/11 14:27:12

如何把 LoRA 权重合并进基础模型:swift 模型合并完整指南 如何把 LoRA 权重合并进基础模型swift 模型合并完整指南【免费下载链接】swiftUse PEFT or Full-parameter to CPT/SFT/DPO/GRPO 600 LLMs (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) and 300 MLLMs (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).项目地址: https://gitcode.com/GitHub_Trending/swift1/swiftLoRA 微调跑完之后很多人会卡在下一步把 checkpoint 直接丢给 vLLM 部署要么直接报错要么推理明显比纯基础模型慢。原因很简单——适配器权重只是一份增量补丁不是完整模型必须先融合回基础模型的权重矩阵里才能独立部署。swift 模型合并swift export --merge_lora子命令就是干这件事的一条命令输入训练好的 checkpoint输出一个可直接上线的完整模型。下面不先讲原理顺序是先跑通拿到合并产物再回头看 swift 底层做了什么最后处理容易踩的坑。把 LoRA checkpoint 直接推上线到底卡在哪LoRA 训练时冻结基础模型的原始权重只在旁边学习两组低秩矩阵 A 和 B。推理时每一层前向要先算原始的 W·x再叠加 (B·A)·scaling 的增量这带来三个实际麻烦适配器不能单独加载必须挂在基础模型上才能跑不少推理引擎对基础模型 适配器的组合处理不如对完整权重顺手多一份计算开销分发模型要同时给基础模型和 checkpoint 目录版本管理麻烦。合并做的事就是把这个增量折进原始权重W W (B·A)·scaling直接写进保存的参数里。合并完的模型不再依赖任何适配器在标准推理框架里的表现和原生模型一致。价值不止是能跑实际表现上完整权重模式的推理开销通常比基础模型 适配器低改善幅度在 15%–30% 这个区间并且天然兼容 vLLM、SGLang 这类部署链路。swift export 替你做了哪些事整个合并流程是四步细节都被swift export收在内部输入只需要一个 LoRA 训练输出目录产出是标准的 Hugging Face 格式模型merged_model/ ├── config.json ├── generation_config.json ├── model-00001-of-00002.safetensors ├── model-00002-of-00002.safetensors └── model.safetensors.index.json这个目录可以直接喂给swift infer、swift deploy或 vLLM无需再加工。快速上手三步参数跑通第一次合并安装并确认环境git clone https://gitcode.com/GitHub_Trending/swift1/swift cd swift pip install -e . swift --version主要依赖需满足torch 2.0、transformers 4.33、peft 0.11、modelscope 1.23。不确定可以用pip list | grep -E torch|transformers|peft核对一遍。合并时的显存参考合并要把完整基础模型读进显存所以显存需求接近甚至略高于该模型的全量推理模型规模最低显存推荐显卡7B16GBRTX 3090 / A1013B24GBRTX 4090 / A10070B80GBA100 / H100合并命令本体最简形态只需要两个参数swift export \ --adapters output/vx-xxx/checkpoint-xxx \ # LoRA 训练的 checkpoint 目录 --merge_lora true # 开启 LoRA 融合 # 可选--output_dir merged_model 指定输出目录⚠️ 容易漏的一点不传--output_dir时swift 默认把结果存到 checkpoint 同级的checkpoint-xxx-merged目录。这个目录如果已存在重跑会直接报错——要么换个输出目录要么加--exist_ok true允许覆盖。如果基础模型没有被自动定位到补一个--model手动指定即可swift export \ --adapters output/vx-xxx/checkpoint-xxx \ --merge_lora true \ --model Qwen/Qwen2.5-7B-Instruct \ # 基础模型 ID 或本地路径 --use_hf true # true 走 Hugging Face 源默认 ModelScope逐行解读基础模型信息从哪来权重存到哪去args.json 是那张小票swift 训练产出的 checkpoint 目录里都带着args.json记录了本次训练用过的--model、框架版本等参数。swift export优先读这个文件所以它知道该加载哪个基础模型、配哪套模板——你只要找得到 checkpoint 目录命令就能跑起来。文件缺失或信息不全时比如 checkpoint 是从别处拷来、目录结构不完整再手动补--model兜底。权重是逐层折进去的对每个挂了 LoRA 的线性层swift 算出低秩增量并直接加进原始权重然后卸载 A/B 矩阵最终保存目录里只剩完整权重。默认以 safetensors 分片保存分片大小由--max_shard_size控制默认 5GB不用操心单文件过大。参数细节可以对照仓库里的 docs/source/Instruction/Export-and-push.md 和最小示例 examples/export/merge_lora.sh。进阶玩法多适配器、量化、对接推理引擎一次合并多个适配器不同任务分别微调过、想合成一个模型时--adapters可以一次传多个目录swift 会按给出的顺序依次加载并融合swift export \ --adapters output/task-a/checkpoint-500 \ output/task-b/checkpoint-800 \ --merge_lora true合并 量化一条命令搞定如果合并完要直接按 4bit 部署不必先落盘再单独量化把量化参数加进来swift 会先完成权重融合再就地量化swift export \ --adapters output/vx-xxx/checkpoint-xxx \ --merge_lora true \ --quant_method gptq \ # 可选 awq / gptq / bnb / fp8 --quant_bits 4 \ # 量化位数常用 4 或 8 --dataset AI-ModelScope/alpaca-gpt4-data-zh#500 \ # 量化校准数据 --quant_n_samples 256 \ --quant_batch_size 1用 awq 或 gptq 时--dataset校准数据是必填项缺了命令会直接报错。直接对接 vLLM 部署合并后的目录就是标准模型目录可以直接作为引擎的启动参数python -m vllm.entrypoints.api_server \ --model merged_model \ --port 8000合并后怎么确认没出错验证与排错✅ 两步验证看文件再跑推理先检查输出目录是否完整对照上面的文件清单再用同一组问题分别跑基础模型 适配器和合并后的模型# 合并前 swift infer \ --model Qwen/Qwen2.5-7B-Instruct \ --adapters output/vx-xxx/checkpoint-xxx # 合并后 swift infer --model merged_model两边输出应当基本一致差异只应来自采样随机性合并模式下延迟的改善一般在 15%–30% 左右。不想碰命令行的话也可以打开 Web UIswift web-ui把合并后的模型路径填进去快速抽查效果。⚠️ 常见错误对照表错误现象可能原因处理办法加载模型时 OOM显存放不下完整权重换更大显存的卡或用--device_map分散显存70B 需要 80GB基础模型下载失败 / 不匹配args.json 里的基础模型信息缺失或不可达手动补--model必要时用--use_hf true换源args.json 缺失或为空checkpoint 不是 swift 训练产出的手动传--model及相关参数提示输出目录已存在-merged目录已经生成过换--output_dir或加--exist_ok true 从合并到上线三条建议保留原始适配器合并完别急着删 checkpoint之后想调整权重或回滚随时可以重新合并版本化命名输出目录加上版本号如merged-model-v1部署和回滚时好辨认显存紧张就合并 量化一步到位直接用前面的合并量化命令生成 4bit 部署包少一道工序。动手路径很短找一个训练好的 LoRA checkpoint跑swift export --adapters checkpoint --merge_lora true再用swift infer --model 输出目录抽查推理结果与合并前一致就可以放心投产了。【免费下载链接】swiftUse PEFT or Full-parameter to CPT/SFT/DPO/GRPO 600 LLMs (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) and 300 MLLMs (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).项目地址: https://gitcode.com/GitHub_Trending/swift1/swift创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/9/11 14:27:12

多维表格搭建CRM商机管理:Teable六级权限体系实战解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/11 14:22:12

MCP与A2A双协议驱动的企业级多智能体协同架构

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/11 15:22:22

小尺寸二维码打印识别率优化方案与实践

1. 项目背景与挑战去年接手公司仓储管理系统升级时,我们遇到了一个看似简单却异常棘手的问题——小尺寸二维码的打印识别率。系统需要在不干胶标签上打印5mm5mm的二维码,用于标识微小零件。初期采用基于Canvas的qrcode.js方案,在屏幕上显示完…

2026/9/11 15:22:22

在线教育大数据分析:Django+Spark+爬虫+Vue实战指南

简介:这是一套基于Django的线上教育平台大数据分析毕设项目,以Python 3.8为基础,整合Spark、爬虫与Vue,面向毕业设计、课程设计、大作业或工程实训场景,既适合入门小白,也适合需要完整工程参考的进阶学习者…

2026/9/11 15:17:21

0.3 TOPS如何重塑端侧AI芯片设计范式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/10 16:39:38

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/10 11:16:38

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/9 16:31:09

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/10 12:32:02

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/10 15:19:50

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/10 15:49:53

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码