发布时间:2026/8/24 14:21:25
即插即用模块 + 改进思路汇总目录 即插即用模块 改进思路汇总目录 卷积注意力Transformer分割扩散模型训练优化本专栏主要整理能够直接嵌入各类深度学习模型中的即插即用模块以及来自顶会、顶刊论文中的网络结构设计与改进思路。内容涵盖卷积模块、注意力机制、Transformer、图像分割、图像恢复、扩散模型、视频生成、损失函数、长尾学习、不确定性估计等方向。在复现论文原始模块的基础上也会结合实际网络结构给出一些二次创新与改进思路方便用于目标检测、图像分类、语义分割、医学图像、遥感图像、低层视觉、生成模型等任务。⭐ 标记说明顶会 / 顶刊相关工作✅文章中提供源码、代码链接或可运行实现即插即用实现 / 模块代码 / 改进思路论文原理与结构解析 总目录一、 卷积模块与轻量化网络Ego内容相似度驱动的卷积神经网络PFGNet频率制导外围门控网络MSCK-Net多尺度中国结卷积网络SCNet自校准卷积SCConv1d SCConv2d即插即用自校准卷积PartialNetPATConv 与动态部分卷积FDConv频率动态卷积LSNet从人类视觉系统学习的轻量级网络ARConv自适应矩形卷积OverLoCK上下文混合动态核卷积DCNv4高效可变形卷积InceptionNeXt Block 改进思路二、 注意力机制与 TransformerAttention Surgery视频扩散 Transformer 线性化DSFormer双选择融合 TransformerMALA幅度感知线性注意力Synthesizer无需标准 Q-K 交互的注意力AST自适应稀疏 Transformer注意力计算中的 Shape / 尺寸记录ECA 注意力机制改进思路CBAM 注意力机制改进思路三、 图像分割、解码与上下采样模块SMMM结构感知多尺度掩蔽模块EMCAD高效多尺度卷积注意解码器MPDMask-aware Pixel-Shuffle Down-Sampling四、 生成模型、扩散模型与视频生成ControlNet-XS轻量化可控图像生成AttriDiffuserKL 正则化自动编码器AttriDiffuser余弦相似度模块StreamingT2V条件注意模块 CAMCLR-GAN一致潜在表征与重建ByTheWay无需训练提升文本生成视频质量五、 损失函数、不确定性与训练优化两步保形预测自适应边界框不确定性DBM Loss困难感知长尾识别平衡边际损失卷积层谱范数的紧凑高效上界长尾数据集蒸馏一、 卷积模块与轻量化网络1. Ego内容相似度驱动的卷积神经网络 ✅关键词CNN、内容相似度、长程依赖、动态特征建模通过内容相似度重新思考传统卷积固定局部连接方式为卷积神经网络引入更加灵活的特征交互机制。 点击查看Ego——内容相似度驱动的卷积神经网络2. PFGNet高效时空预测学习的频率制导外围门控网络 关键词时空预测、频率建模、外围卷积、动态门控面向时空预测任务将频率信息与大范围空间信息建模结合起来适合研究大感受野卷积和时空特征交互。 点击查看PFGNet——频率制导外围门控网络3. MSCK-Net基于多尺度中国结卷积网络的微光红外舰船检测 ✅关键词红外小目标、多尺度特征、CKConv、舰船检测针对微光红外图像中的舰船检测问题设计多尺度卷积结构对红外小目标、遥感目标检测具有较好的借鉴意义。 点击查看MSCK-Net——多尺度中国结卷积网络4. SCNet用自校准卷积改进卷积网络 ✅关键词Self-Calibrated Convolution、SCConv、跨尺度信息、自校准SCConv 通过特征内部的信息交互扩大有效感受野并增强卷积特征的判别能力是非常经典的即插即用卷积改进模块。 点击查看SCNet——用自校准卷积改进卷积网络5. SCConv1d SCConv2d即插即用自校准卷积模块 关键词SCConv1d、SCConv2d、PyTorch、模块替换在 SCConv 原理基础上进一步整理一维与二维版本可用于时序数据、图像任务以及现有卷积层的直接替换。 点击查看SCConv1d SCConv2d 使用指南6. PartialNetPATConv 与动态部分卷积关键词Partial Convolution、PATConv、DPConv、轻量化通过局部特征计算和动态部分卷积减少冗余计算为轻量级网络设计和高效特征提取提供新的结构思路。 点击查看PartialNet——PATConv 与动态部分卷积7. FDConv用于密集图像预测的频率动态卷积 关键词FDConv、Frequency、Dynamic Convolution、密集预测从频率域角度重新设计动态卷积让卷积核具备更加灵活的频率响应能力可用于检测、分割等密集预测任务。 点击查看FDConv——频率动态卷积8. LSNet从人类视觉系统中学到的轻量级网络设计 关键词Lightweight Network、视觉感知、大核卷积、动态特征从人类视觉系统的感知机制出发设计轻量级网络对轻量化 Backbone 和高效卷积结构设计具有参考价值。 点击查看LSNet——从人类视觉系统中学习轻量级网络设计9. ARConv自适应矩形卷积 关键词ARConv、矩形卷积、自适应采样、遥感突破传统固定正方形卷积核的限制使卷积能够根据目标形状自适应调整采样区域。 点击查看ARConv——自适应矩形卷积10. OverLoCK上下文混合动态核卷积关键词Dynamic Kernel、Context Mixing、ConvNet、上下文建模利用上下文信息动态调节卷积特征提取过程适合用于探索卷积网络中的动态感受野与上下文交互。 点击查看OverLoCK——上下文混合动态核卷积11. DCNv4高效可变形卷积算子 关键词DCNv4、Deformable Convolution、动态采样、算子优化DCNv4 对可变形卷积进行进一步简化和优化在保持动态空间建模能力的同时提升计算效率。 点击查看DCNv4——高效可变形卷积算子12. InceptionNeXt Block 改进思路 关键词InceptionNeXt、ConvNeXt、DWConv、多尺度卷积围绕 InceptionNeXt Block 的多分支卷积结构展开可进一步尝试动态卷积、不同尺度卷积以及注意力机制融合。 点击查看InceptionNeXt Block 改进思路二、 注意力机制与 Transformer1. Attention Surgery让视频扩散 Transformer 线性化 关键词Video Diffusion、Linear Attention、Transformer、推理加速针对视频扩散 Transformer 中注意力计算复杂度较高的问题对注意力结构进行重新设计为长视频生成和高效注意力提供新思路。 点击查看Attention Surgery2. DSFormer高光谱图像分类的双选择融合 Transformer关键词Hyperspectral、Transformer、Token Selection、多尺度融合针对高光谱图像丰富的空间—光谱信息设计双选择融合结构对遥感分类及多维特征建模具有参考价值。 点击查看DSFormer——双选择融合 Transformer3. MALA修正线性注意中的幅度忽略 关键词Linear Attention、Magnitude、Softmax、Attention从“幅度信息被忽略”的角度分析传统线性注意力并提出相应改进机制对高效 Transformer 的设计很有启发。 点击查看MALA——幅度感知线性注意力4. Synthesizer 的大致代码 关键词Synthesizer、Self-Attention、Transformer、随机注意力Synthesizer 探索不依赖传统 Query-Key 点积的注意力生成方式可用于理解 Self-Attention 中真正重要的组成部分。 点击查看Synthesizer 的大致代码5. AST关注特征细化的图像恢复自适应稀疏变换 ✅关键词Image Restoration、Sparse Attention、Transformer、FRFN通过自适应稀疏注意力和特征细化机制增强图像恢复能力对去雨、去模糊、去噪等低层视觉任务具有较强参考价值。 点击查看AST——自适应稀疏变换6. 注意力计算的形状尺寸记录 关键词Q、K、V、Multi-Head Attention、Tensor Shape记录注意力机制在实际代码实现过程中各阶段 Tensor 的 Shape 变化适合排查维度错误和理解多头注意力计算过程。 点击查看注意力计算的形状尺寸记录7. ECA 注意力机制改进思路 关键词ECA、Channel Attention、1D Convolution、通道交互围绕 ECA 高效通道注意力机制进行二次改进可尝试多尺度卷积、自适应卷积核以及空间注意力融合。 点击查看ECA 注意力机制改进思路8. CBAM 注意力机制改进思路 关键词CBAM、Channel Attention、Spatial Attention、注意力改进经典的通道注意力 空间注意力组合模块结构简单适合嵌入 CNN、YOLO、U-Net 等模型中继续进行改进。 点击查看CBAM 改进思路三、 图像分割、解码与上下采样模块1. SMMM结构感知多尺度掩蔽模块 ✅关键词Medical Segmentation、多尺度、Mask、结构感知面向医学图像分割设计的多尺度掩蔽结构通过不同尺度和结构信息增强目标边界与区域表征。 点击查看SMMM——结构感知多尺度掩蔽模块2. EMCAD高效多尺度卷积注意解码模块 关键词Decoder、Multi-Scale Convolution、Attention、医学图像分割采用多尺度卷积和注意力机制构建高效解码器可直接借鉴到 U-Net、Encoder-Decoder 等分割框架中。 点击查看EMCAD——高效多尺度卷积注意解码模块3. MPDMask-aware Pixel-Shuffle Down-Sampling 关键词PixelUnshuffle、Down-Sampling、Mask-aware、特征保留从传统下采样容易损失空间细节的问题出发通过 Pixel-Shuffle / Pixel-Unshuffle 思路进行信息重排。 点击查看MPD 下采样模块四、 生成模型、扩散模型与视频生成1. ControlNet-XS从反馈控制系统重新思考图像生成控制机制 关键词ControlNet、Diffusion、反馈控制、可控生成从反馈控制系统角度重新分析条件生成机制以更加轻量的控制分支实现扩散模型的可控生成。 点击查看ControlNet-XS2. AttriDiffuserKL 正则化自动编码器 ✅关键词AutoencoderKL、VAE、Latent Space、Diffusion围绕 AttriDiffuser 中的 KL 正则化自动编码器展开适合理解潜空间扩散模型中的编码与重建机制。 点击查看AttriDiffuser——KL 正则化自动编码器3. AttriDiffuser余弦相似度 ✅关键词Cosine Similarity、Feature Matching、DeepFace、属性保持主要整理 AttriDiffuser 中基于余弦相似度的特征约束与匹配思想。 点击查看AttriDiffuser——余弦相似度4. StreamingT2V条件注意模块 CAM 关键词Text-to-Video、CAM、Conditional Attention、Video Diffusion整理 StreamingT2V 中条件注意模块的结构可用于研究长视频生成中的条件信息注入与跨帧建模。 点击查看StreamingT2V——条件注意模块 CAM5. CLR-GAN一致潜在表征与重建关键词GAN、Latent Representation、Reconstruction、训练稳定性通过潜在空间一致性和重建约束提升 GAN 的训练稳定性与生成质量。 点击查看CLR-GAN6. ByTheWay无需训练提升文本生成视频质量 ✅关键词Text-to-Video、Training-Free、Temporal Attention、视频生成一种无需额外训练即可增强已有文本生成视频模型的方法为低成本视频生成增强提供了新的插件化思路。 点击查看ByTheWay——无需训练提升文本生成视频质量五、 损失函数、不确定性与训练优化1. 基于两步保形预测的自适应边界框不确定性 关键词Conformal Prediction、Uncertainty、Bounding Box、目标检测利用保形预测对目标检测边界框的不确定性进行估计对高可靠目标检测和置信区间预测具有参考意义。 点击查看两步保形预测与自适应边界框不确定性2. DBM Loss困难感知的长尾识别平衡边际损失 关键词Long-Tailed Recognition、Hard Sample、Margin Loss、类别不平衡针对长尾识别中的类别不平衡和困难样本问题设计新的 Margin 调整机制可作为分类网络中的即插即用损失函数。 点击查看DBM Loss——困难感知长尾识别平衡边际损失3. 卷积层谱范数的紧凑高效上界关键词Spectral Norm、Convolution、Lipschitz、Regularization研究卷积层谱范数的高效估计方法可用于网络稳定性、鲁棒性以及 Lipschitz 约束相关研究。 点击查看卷积层谱范数的紧凑高效上界4. 长尾数据集蒸馏 ✅关键词Dataset Distillation、Long-Tailed Learning、类别不平衡、知识蒸馏将数据集蒸馏思想应用到长尾学习场景通过更紧凑、更具代表性的训练样本缓解类别不平衡问题。 点击查看长尾数据集蒸馏 按模块类型快速检索 想改进卷积 / Backbone推荐优先阅读Ego → SCConv → PartialNet → FDConv → LSNet → ARConv → OverLoCK → DCNv4 → InceptionNeXt适合YOLO / ResNet / ConvNeXt / U-Net / 遥感检测 / 图像分类 / 轻量化网络 想改进注意力机制推荐优先阅读MALA → AST → ECA → CBAM → Synthesizer → DSFormer → Attention Surgery适合Transformer / ViT / CNN-Attention / 图像恢复 / 高光谱分类 / 视频扩散 想改进分割网络推荐优先阅读SMMM → EMCAD → MPD适合U-Net / 医学图像分割 / 语义分割 / 小目标分割 / Encoder-Decoder 想改进扩散模型 / 视频生成推荐优先阅读ControlNet-XS → AttriDiffuser → StreamingT2V → ByTheWay → Attention Surgery适合Stable Diffusion / ControlNet / Text-to-Video / Video Diffusion / 可控生成 想改进训练策略 / Loss推荐优先阅读DBM Loss → 两步保形预测 → 长尾数据集蒸馏 → 卷积层谱范数适合长尾分类 / 目标检测 / 不确定性估计 / 网络正则化 / 鲁棒训练 顶会论文方向快速索引CVPR / ICCV / ECCV / AAAI / ICML 等方向Attention SurgeryEgoPFGNetMALAFDConvLSNetARConvByTheWay长尾数据集蒸馏DCNv4ASTInceptionNeXtControlNet-XS两步保形预测SMMMDBM LossSCNetSynthesizerCBAM 代码实现 / 即插即用优先阅读如果目标是直接拿模块改网络建议优先阅读SCConv1d SCConv2d→ 适合直接替换普通卷积。ECA / CBAM→ 适合快速加入通道或空间注意力。DCNv4 / ARConv / FDConv→ 适合从卷积采样方式、动态卷积核方向进行创新。PartialNet / InceptionNeXt→ 适合轻量化 Backbone 与多尺度卷积设计。EMCAD / SMMM / MPD→ 适合分割网络 Decoder 与上下采样结构创新。MALA / Synthesizer / AST→ 适合 Transformer 与 Attention 结构创新。ControlNet-XS / StreamingT2V CAM / ByTheWay→ 适合扩散模型和视频生成模型的插件式改进。 后续更新本目录将持续更新。后续主要补充① 顶会 / 顶刊中的即插即用模块② 卷积、注意力、Transformer 的最新结构③ YOLO、U-Net、ResNet 等模型的模块替换方案④ 图像恢复、医学分割、遥感检测、生成模型等任务中的改进模块⑤ 各类模块的二次创新与组合改进思路如果对某个模块感兴趣可以直接通过本文目录跳转到对应文章。持续更新中……

相关新闻

2026/8/24 14:21:25

LX Music 免费聚合多源音乐的桌面播放器

LX Music 免费聚合多源音乐的桌面播放器 【免费下载链接】lx-music-desktop 一个基于 Electron 的音乐软件 项目地址: https://gitcode.com/GitHub_Trending/lx/lx-music-desktop LX Music 是一款基于 Apache License 2.0 协议发行的开源桌面音乐播放器,把酷…

2026/8/24 14:16:24

DeepSeek LeetCode LCP 24. 数字游戏 Python3实现

这道题 LCP 24. 数字游戏 的核心是 数学转化 对顶堆动态维护中位数。 Python3 实现时,利用 heapq 模块,用负数模拟最大堆,逻辑清晰且高效。---解题思路1. 问题转化最终需要满足 nums[i1] nums[i] 1,等价于将 nums[i] - i 变成同…

2026/8/24 16:31:47

机器学习特征工程:非数值数据编码实战指南

1. 项目概述:为什么非数值数据是特征工程的“硬骨头” 做机器学习项目,尤其是处理真实世界的数据集时,你大概率会遇到这样的场景:打开数据集一看,除了规整的数字,还混杂着“北京”、“上海”、“男”、“女…

2026/8/24 16:26:46

分类模型实战指南:从逻辑回归到随机森林的选型、调参与避坑

1. 从“分类”说起:为什么它不只是个数学题如果你参加过数学建模竞赛,或者接触过数据分析,大概率听过“分类”这个词。听起来挺学术的,对吧?但它的影子无处不在。银行要判断一笔贷款申请是“通过”还是“拒绝”&#x…

2026/8/24 0:07:22

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/24 1:12:32

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/24 8:17:29

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/24 1:09:25

3条命令跑通LocalAI:无GPU本地AI引擎部署

3条命令跑通LocalAI:无GPU本地AI引擎部署 【免费下载链接】LocalAI LocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required. 项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI…

2026/8/24 1:09:25

AI推理性能测试怎么做:MLPerf Inference完整上手指南

AI推理性能测试怎么做:MLPerf Inference完整上手指南 【免费下载链接】inference Reference implementations of MLPerf inference benchmarks 项目地址: https://gitcode.com/gh_mirrors/inf/inference 同一个模型换一张卡,速度快多少你知道吗&a…

2026/8/24 13:42:17

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/23 6:14:43

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/23 4:22:01

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…