发布时间:2026/7/22 14:54:39
021、RepVGG重参数化骨干:训练时多分支与推理时单路结构的YOLOv8实现 021、RepVGG重参数化骨干训练时多分支与推理时单路结构的YOLOv8实现从一次诡异的精度回退说起去年有个项目需要在边缘设备上跑YOLOv8n客户要求FPS不低于60。我把骨干换成ShuffleNetV2速度是上去了但mAP掉了将近4个点。换回原版C2f速度又不够。折腾了两周突然想起RepVGG那篇论文——训练时用多分支结构学得更充分推理时等价合并成单路既保精度又提速度。这个思路用在YOLOv8的骨干上简直是为边缘部署量身定做的。RepVGG的核心思想训练和推理是两套结构很多人第一次看RepVGG的代码会懵怎么forward里还有if判断其实它的设计哲学很简单训练时用3×3卷积1×1卷积恒等映射三条分支让梯度回传路径更丰富推理时把这三条分支等价合并成一个3×3卷积计算量直接砍掉三分之二。这里有个关键点——合并的前提是卷积核尺寸相同。1×1卷积和恒等映射怎么合并成3×3答案是补零。1×1卷积在3×3的kernel里只有中心点非零恒等映射等价于一个单位矩阵卷积同样可以填充成3×3的稀疏形式。BN层的合并更是常规操作把BN的缩放因子和偏置吸收进卷积权重里。YOLOv8里怎么塞进RepVGGYOLOv8的骨干是C2f模块本质是跨阶段局部网络。我尝试了两种改造方案方案一把C2f里的Bottleneck替换成RepVGGBlock。这个改动最小但效果一般因为RepVGGBlock本身没有跨层连接和C2f的设计思路有点冲突。方案二直接替换整个C2f为RepVGGStage。这个改动大一些但更彻底。具体做法是把C2f的split操作去掉用几个RepVGGBlock堆叠每个Block之间用1×1卷积做通道变换。我最终选了方案二因为实测下来mAP高了0.7个点参数量还少了15%。这里有个坑——RepVGGBlock的stride参数要小心处理。YOLOv8的骨干里有下采样层如果直接把stride2的RepVGGBlock放进去合并后的卷积感受野会出问题。我的做法是单独用一个stride2的3×3卷积做下采样后面再接stride1的RepVGGBlock。代码实现里的那些坑先看RepVGGBlock的核心实现。训练时forward是这样的defforward(self,x):ifself.training:# 训练时走多分支returnself.rbr_identity(x)self.rbr_1x1(x)self.rbr_3x3(x)else:# 推理时走合并后的单路returnself.rbr_reparam(x)注意这个self.training的判断PyTorch的model.train()和model.eval()会自动切换。但有个坑——如果你用torch.no_grad()做推理self.training还是True必须显式调用model.eval()。我之前在验证集上跑忘了切模式结果精度异常低排查了半天才发现是分支没合并。合并函数是重头戏deffuse_conv_bn(self,conv,bn):# 把BN的gamma和beta吸收进卷积权重# 这里踩过坑BN的running_mean和running_var要detach不然梯度会传回去wconv.weight meanbn.running_mean.detach()varbn.running_var.detach()gammabn.weight.detach()betabn.bias.detach()epsbn.eps# 计算等效卷积权重和偏置std(vareps).sqrt()w_fusedw*(gamma/std).view(-1,1,1,1)b_fusedbeta-gamma*mean/stdifconv.biasisnotNone:b_fusedconv.bias*(gamma/std).view(-1)returnw_fused,b_fused这里有个细节1×1卷积合并成3×3时需要在四周补零。别这样写# 错误示范直接reshapew_1x1conv_1x1.weight.reshape(-1,1,3,3)# 这样不对正确做法是用torch.nn.functional.padw_1x1torch.nn.functional.pad(conv_1x1.weight,[1,1,1,1])恒等映射更tricky。它等价于一个卷积核为单位矩阵的3×3卷积但输入输出通道必须相同。如果通道数不同这条分支直接去掉。实现时我踩过坑——直接用torch.eye生成单位矩阵但忘了考虑分组卷积的情况。YOLOv8里没有分组卷积所以还好。训练策略的调整换了RepVGG骨干后训练超参数需要微调。我发现几个关键点学习率要降低。原版YOLOv8用0.01的初始学习率RepVGG因为多分支结构梯度更丰富容易震荡。我降到0.005配合warmup稳定很多。权重衰减要加大。RepVGG的多分支结构天然有正则化效果但为了推理时合并后的权重更干净我把weight_decay从0.0005提到0.001。别加太多不然训练loss下不去。BN的momentum要调小。默认0.1对于RepVGG来说太大了因为多分支的BN统计量不稳定。我改成0.01让running_mean和running_var更新更平滑。推理时的合并时机合并操作在模型导出时做。我写了个工具函数遍历模型的所有模块遇到RepVGGBlock就调用merge方法。注意顺序——先合并BN再合并分支最后赋值给rbr_reparam。有个坑如果你用torch.jit.script或者onnx导出必须在导出前完成合并。因为script不支持动态的if self.training判断。我试过在forward里写条件分支结果torch.jit报错说无法解析条件表达式。合并后的模型可以直接用torch.save保存下次加载时就是单路结构。但如果你想保留训练能力建议保存两份权重——一份合并后的用于部署一份原始的多分支用于继续训练。实际效果在COCO数据集上用YOLOv8n做baseline替换RepVGG骨干后mAP0.5:0.95从37.3%涨到37.9%涨了0.6个点参数量从3.2M降到2.8M降了12.5%推理速度在TensorRT上从2.1ms降到1.7ms快了19%这个收益在轻量级模型上更明显。YOLOv8s从44.5%涨到45.2%参数量降了10%。但YOLOv8m以上收益递减因为大模型本身容量够大多分支带来的正则化效果不明显。个人经验RepVGG这个trick最适合的场景是边缘部署轻量级模型。如果你的模型已经很大了比如YOLOv8x换这个收益不大反而增加训练复杂度。训练时注意监控三个分支的梯度范数。如果某个分支的梯度一直很小说明这个分支没学到东西可以考虑去掉。我遇到过恒等映射分支梯度几乎为零的情况后来发现是通道数不匹配这条分支根本没起作用。合并后的模型对量化更友好。单路结构的权重分布更集中量化误差更小。我在INT8量化时RepVGG骨干的模型精度只掉了0.3个点原版C2f掉了0.8个点。最后说一句别在训练过程中做合并。有人想在每个epoch结束后合并一次再继续训练这会导致BN统计量混乱精度反而下降。训练和推理的结构必须严格分离。下一期准备写DenseNet风格的密集连接怎么融入YOLOv8的Neck那个坑更多到时候再聊。

相关新闻

2026/7/22 14:54:39

上虞颜值与口感兼顾的 5 家咖啡融合馆

在咖啡香气弥漫的上虞,有这样几家咖啡融合馆,它们用独特的创意与精湛的技艺,将颜值与口感完美融合,成为咖啡爱好者们不可错过的打卡地。下面就为大家详细介绍其中5家。 ** 一、上虞苦甜序 ** 上虞苦甜序无疑是咖啡融合界的一颗璀璨…

2026/7/22 14:49:39

在自动化脚本中如何使用大语言模型(LLM)?

一、概述大语言模型(Large Language Model, LLM)近年来在自然语言处理领域取得了突破性进展,广泛应用于自动聊天、智能客服、内容生成、代码辅助等场景。与一般通过HTTP SDK调用第三方大模型API的方式不同,冰狐平台将LLM调用封装为…

2026/7/22 14:49:39

涨薪技术|掌握带安全认证的接口测试

接口安全测试通常包括以下几种:身份验证和授权测试:测试接口是否正确实现了身份验证和授权,以防止未授权访问或不合法的访问。输入验证测试:测试接口是否正确验证输入参数,以防止非法输入参数和SQL注入攻击等。输出验证…

2026/7/22 17:44:59

pyFDA与Amaranth结合:FPGA滤波器设计与实现

pyFDA与Amaranth结合:FPGA滤波器设计与实现 【免费下载链接】pyfda Python Filter Design Analysis Tool 项目地址: https://gitcode.com/gh_mirrors/py/pyfda pyFDA(Python Filter Design Analysis Tool)是一款强大的滤波器设计与分析…

2026/7/22 17:44:59

测试面试避坑指南:这10个高频问题答对了,薪资至少涨30%

关注 「软件测试就业联盟」公众号,陪你走好校招求职的每一步最近半年,你周围有没有人面试聊得挺好,最后薪资却卡在某个数字再也谈不上去?甚至不少人反馈,明明问题都答上来了,面试官就是不给过。原因其实很扎…

2026/7/22 17:44:59

卷积稀疏编码

参考视频:【图像稀疏表示 (4-2)】 https://www.bilibili.com/video/BV1qq4y1Z76F/?share_sourcecopy_web&vd_sourcec0697661320dab63e5710ea1fb58458f一. 稀疏表示可以用元素周期表类比字典D,一个物质类比图像X,从…

2026/7/22 9:29:13

Unity与Python本地通信:基于Flask的跨语言数据交换实战

1. 项目概述:为什么我们需要一个本地通信服务器?在游戏开发、数字孪生、仿真训练等众多领域,Unity作为强大的实时3D内容创作平台,其核心逻辑通常由C#驱动。然而,当我们需要进行复杂的数据分析、机器学习推理、科学计算…

2026/7/22 0:02:17

抓包代理链路下的 TLS 指纹变化分析 TLSFOWARD抓包工具

抓包代理链路下的 TLS 指纹变化分析:为什么调试环境会影响访问结果 摘要 在网页调试、接口联调、自动化巡检和授权采集排查中,抓包是常见手段。但很多开发者会遇到一个现象:正常访问页面时没有问题,一进入抓包或代理调试环境&…

2026/7/22 0:02:17

微信QQ聊天记录误删恢复与备份方案全指南

1. 聊天记录误删的常见场景与恢复思路作为一名长期关注数据安全的技术博主,我处理过上百起聊天记录误删的求助案例。手机误操作、系统升级失败、设备损坏是三大常见诱因。上周就遇到用户更新微信时断电,导致近两年的工作群聊记录全部消失的极端案例。不同…

2026/7/22 0:02:17

2026最新8款个人AI编程免费工具深度实测

作为一名全栈独立开发者,我最近半年一直在折腾副业项目,每个月在AI编程工具上的订阅费算下来其实也不算便宜。作为个人开发者,我们追求的就是用最少的成本获得最高效的开发体验。TRAE 基础版免费,字节跳动出品的国内首款 AI 原生 …

2026/7/21 20:02:44

3个高效策略:快速掌握Axure中文界面配置

3个高效策略:快速掌握Axure中文界面配置 【免费下载链接】axure-cn Chinese language file for Axure RP. Axure RP 简体中文语言包。支持 Axure 11、10、9。不定期更新。 项目地址: https://gitcode.com/gh_mirrors/ax/axure-cn 还在为Axure RP的英文界面感…