即插即用模块 + 改进思路汇总目录
即插即用模块 改进思路汇总目录 卷积注意力Transformer分割扩散模型训练优化本专栏主要整理能够直接嵌入各类深度学习模型中的即插即用模块以及来自顶会、顶刊论文中的网络结构设计与改进思路。内容涵盖卷积模块、注意力机制、Transformer、图像分割、图像恢复、扩散模型、视频生成、损失函数、长尾学习、不确定性估计等方向。在复现论文原始模块的基础上也会结合实际网络结构给出一些二次创新与改进思路方便用于目标检测、图像分类、语义分割、医学图像、遥感图像、低层视觉、生成模型等任务。⭐ 标记说明顶会 / 顶刊相关工作✅文章中提供源码、代码链接或可运行实现即插即用实现 / 模块代码 / 改进思路论文原理与结构解析 总目录一、 卷积模块与轻量化网络Ego内容相似度驱动的卷积神经网络PFGNet频率制导外围门控网络MSCK-Net多尺度中国结卷积网络SCNet自校准卷积SCConv1d SCConv2d即插即用自校准卷积PartialNetPATConv 与动态部分卷积FDConv频率动态卷积LSNet从人类视觉系统学习的轻量级网络ARConv自适应矩形卷积OverLoCK上下文混合动态核卷积DCNv4高效可变形卷积InceptionNeXt Block 改进思路二、 注意力机制与 TransformerAttention Surgery视频扩散 Transformer 线性化DSFormer双选择融合 TransformerMALA幅度感知线性注意力Synthesizer无需标准 Q-K 交互的注意力AST自适应稀疏 Transformer注意力计算中的 Shape / 尺寸记录ECA 注意力机制改进思路CBAM 注意力机制改进思路三、 图像分割、解码与上下采样模块SMMM结构感知多尺度掩蔽模块EMCAD高效多尺度卷积注意解码器MPDMask-aware Pixel-Shuffle Down-Sampling四、 生成模型、扩散模型与视频生成ControlNet-XS轻量化可控图像生成AttriDiffuserKL 正则化自动编码器AttriDiffuser余弦相似度模块StreamingT2V条件注意模块 CAMCLR-GAN一致潜在表征与重建ByTheWay无需训练提升文本生成视频质量五、 损失函数、不确定性与训练优化两步保形预测自适应边界框不确定性DBM Loss困难感知长尾识别平衡边际损失卷积层谱范数的紧凑高效上界长尾数据集蒸馏一、 卷积模块与轻量化网络1. Ego内容相似度驱动的卷积神经网络 ✅关键词CNN、内容相似度、长程依赖、动态特征建模通过内容相似度重新思考传统卷积固定局部连接方式为卷积神经网络引入更加灵活的特征交互机制。 点击查看Ego——内容相似度驱动的卷积神经网络2. PFGNet高效时空预测学习的频率制导外围门控网络 关键词时空预测、频率建模、外围卷积、动态门控面向时空预测任务将频率信息与大范围空间信息建模结合起来适合研究大感受野卷积和时空特征交互。 点击查看PFGNet——频率制导外围门控网络3. MSCK-Net基于多尺度中国结卷积网络的微光红外舰船检测 ✅关键词红外小目标、多尺度特征、CKConv、舰船检测针对微光红外图像中的舰船检测问题设计多尺度卷积结构对红外小目标、遥感目标检测具有较好的借鉴意义。 点击查看MSCK-Net——多尺度中国结卷积网络4. SCNet用自校准卷积改进卷积网络 ✅关键词Self-Calibrated Convolution、SCConv、跨尺度信息、自校准SCConv 通过特征内部的信息交互扩大有效感受野并增强卷积特征的判别能力是非常经典的即插即用卷积改进模块。 点击查看SCNet——用自校准卷积改进卷积网络5. SCConv1d SCConv2d即插即用自校准卷积模块 关键词SCConv1d、SCConv2d、PyTorch、模块替换在 SCConv 原理基础上进一步整理一维与二维版本可用于时序数据、图像任务以及现有卷积层的直接替换。 点击查看SCConv1d SCConv2d 使用指南6. PartialNetPATConv 与动态部分卷积关键词Partial Convolution、PATConv、DPConv、轻量化通过局部特征计算和动态部分卷积减少冗余计算为轻量级网络设计和高效特征提取提供新的结构思路。 点击查看PartialNet——PATConv 与动态部分卷积7. FDConv用于密集图像预测的频率动态卷积 关键词FDConv、Frequency、Dynamic Convolution、密集预测从频率域角度重新设计动态卷积让卷积核具备更加灵活的频率响应能力可用于检测、分割等密集预测任务。 点击查看FDConv——频率动态卷积8. LSNet从人类视觉系统中学到的轻量级网络设计 关键词Lightweight Network、视觉感知、大核卷积、动态特征从人类视觉系统的感知机制出发设计轻量级网络对轻量化 Backbone 和高效卷积结构设计具有参考价值。 点击查看LSNet——从人类视觉系统中学习轻量级网络设计9. ARConv自适应矩形卷积 关键词ARConv、矩形卷积、自适应采样、遥感突破传统固定正方形卷积核的限制使卷积能够根据目标形状自适应调整采样区域。 点击查看ARConv——自适应矩形卷积10. OverLoCK上下文混合动态核卷积关键词Dynamic Kernel、Context Mixing、ConvNet、上下文建模利用上下文信息动态调节卷积特征提取过程适合用于探索卷积网络中的动态感受野与上下文交互。 点击查看OverLoCK——上下文混合动态核卷积11. DCNv4高效可变形卷积算子 关键词DCNv4、Deformable Convolution、动态采样、算子优化DCNv4 对可变形卷积进行进一步简化和优化在保持动态空间建模能力的同时提升计算效率。 点击查看DCNv4——高效可变形卷积算子12. InceptionNeXt Block 改进思路 关键词InceptionNeXt、ConvNeXt、DWConv、多尺度卷积围绕 InceptionNeXt Block 的多分支卷积结构展开可进一步尝试动态卷积、不同尺度卷积以及注意力机制融合。 点击查看InceptionNeXt Block 改进思路二、 注意力机制与 Transformer1. Attention Surgery让视频扩散 Transformer 线性化 关键词Video Diffusion、Linear Attention、Transformer、推理加速针对视频扩散 Transformer 中注意力计算复杂度较高的问题对注意力结构进行重新设计为长视频生成和高效注意力提供新思路。 点击查看Attention Surgery2. DSFormer高光谱图像分类的双选择融合 Transformer关键词Hyperspectral、Transformer、Token Selection、多尺度融合针对高光谱图像丰富的空间—光谱信息设计双选择融合结构对遥感分类及多维特征建模具有参考价值。 点击查看DSFormer——双选择融合 Transformer3. MALA修正线性注意中的幅度忽略 关键词Linear Attention、Magnitude、Softmax、Attention从“幅度信息被忽略”的角度分析传统线性注意力并提出相应改进机制对高效 Transformer 的设计很有启发。 点击查看MALA——幅度感知线性注意力4. Synthesizer 的大致代码 关键词Synthesizer、Self-Attention、Transformer、随机注意力Synthesizer 探索不依赖传统 Query-Key 点积的注意力生成方式可用于理解 Self-Attention 中真正重要的组成部分。 点击查看Synthesizer 的大致代码5. AST关注特征细化的图像恢复自适应稀疏变换 ✅关键词Image Restoration、Sparse Attention、Transformer、FRFN通过自适应稀疏注意力和特征细化机制增强图像恢复能力对去雨、去模糊、去噪等低层视觉任务具有较强参考价值。 点击查看AST——自适应稀疏变换6. 注意力计算的形状尺寸记录 关键词Q、K、V、Multi-Head Attention、Tensor Shape记录注意力机制在实际代码实现过程中各阶段 Tensor 的 Shape 变化适合排查维度错误和理解多头注意力计算过程。 点击查看注意力计算的形状尺寸记录7. ECA 注意力机制改进思路 关键词ECA、Channel Attention、1D Convolution、通道交互围绕 ECA 高效通道注意力机制进行二次改进可尝试多尺度卷积、自适应卷积核以及空间注意力融合。 点击查看ECA 注意力机制改进思路8. CBAM 注意力机制改进思路 关键词CBAM、Channel Attention、Spatial Attention、注意力改进经典的通道注意力 空间注意力组合模块结构简单适合嵌入 CNN、YOLO、U-Net 等模型中继续进行改进。 点击查看CBAM 改进思路三、 图像分割、解码与上下采样模块1. SMMM结构感知多尺度掩蔽模块 ✅关键词Medical Segmentation、多尺度、Mask、结构感知面向医学图像分割设计的多尺度掩蔽结构通过不同尺度和结构信息增强目标边界与区域表征。 点击查看SMMM——结构感知多尺度掩蔽模块2. EMCAD高效多尺度卷积注意解码模块 关键词Decoder、Multi-Scale Convolution、Attention、医学图像分割采用多尺度卷积和注意力机制构建高效解码器可直接借鉴到 U-Net、Encoder-Decoder 等分割框架中。 点击查看EMCAD——高效多尺度卷积注意解码模块3. MPDMask-aware Pixel-Shuffle Down-Sampling 关键词PixelUnshuffle、Down-Sampling、Mask-aware、特征保留从传统下采样容易损失空间细节的问题出发通过 Pixel-Shuffle / Pixel-Unshuffle 思路进行信息重排。 点击查看MPD 下采样模块四、 生成模型、扩散模型与视频生成1. ControlNet-XS从反馈控制系统重新思考图像生成控制机制 关键词ControlNet、Diffusion、反馈控制、可控生成从反馈控制系统角度重新分析条件生成机制以更加轻量的控制分支实现扩散模型的可控生成。 点击查看ControlNet-XS2. AttriDiffuserKL 正则化自动编码器 ✅关键词AutoencoderKL、VAE、Latent Space、Diffusion围绕 AttriDiffuser 中的 KL 正则化自动编码器展开适合理解潜空间扩散模型中的编码与重建机制。 点击查看AttriDiffuser——KL 正则化自动编码器3. AttriDiffuser余弦相似度 ✅关键词Cosine Similarity、Feature Matching、DeepFace、属性保持主要整理 AttriDiffuser 中基于余弦相似度的特征约束与匹配思想。 点击查看AttriDiffuser——余弦相似度4. StreamingT2V条件注意模块 CAM 关键词Text-to-Video、CAM、Conditional Attention、Video Diffusion整理 StreamingT2V 中条件注意模块的结构可用于研究长视频生成中的条件信息注入与跨帧建模。 点击查看StreamingT2V——条件注意模块 CAM5. CLR-GAN一致潜在表征与重建关键词GAN、Latent Representation、Reconstruction、训练稳定性通过潜在空间一致性和重建约束提升 GAN 的训练稳定性与生成质量。 点击查看CLR-GAN6. ByTheWay无需训练提升文本生成视频质量 ✅关键词Text-to-Video、Training-Free、Temporal Attention、视频生成一种无需额外训练即可增强已有文本生成视频模型的方法为低成本视频生成增强提供了新的插件化思路。 点击查看ByTheWay——无需训练提升文本生成视频质量五、 损失函数、不确定性与训练优化1. 基于两步保形预测的自适应边界框不确定性 关键词Conformal Prediction、Uncertainty、Bounding Box、目标检测利用保形预测对目标检测边界框的不确定性进行估计对高可靠目标检测和置信区间预测具有参考意义。 点击查看两步保形预测与自适应边界框不确定性2. DBM Loss困难感知的长尾识别平衡边际损失 关键词Long-Tailed Recognition、Hard Sample、Margin Loss、类别不平衡针对长尾识别中的类别不平衡和困难样本问题设计新的 Margin 调整机制可作为分类网络中的即插即用损失函数。 点击查看DBM Loss——困难感知长尾识别平衡边际损失3. 卷积层谱范数的紧凑高效上界关键词Spectral Norm、Convolution、Lipschitz、Regularization研究卷积层谱范数的高效估计方法可用于网络稳定性、鲁棒性以及 Lipschitz 约束相关研究。 点击查看卷积层谱范数的紧凑高效上界4. 长尾数据集蒸馏 ✅关键词Dataset Distillation、Long-Tailed Learning、类别不平衡、知识蒸馏将数据集蒸馏思想应用到长尾学习场景通过更紧凑、更具代表性的训练样本缓解类别不平衡问题。 点击查看长尾数据集蒸馏 按模块类型快速检索 想改进卷积 / Backbone推荐优先阅读Ego → SCConv → PartialNet → FDConv → LSNet → ARConv → OverLoCK → DCNv4 → InceptionNeXt适合YOLO / ResNet / ConvNeXt / U-Net / 遥感检测 / 图像分类 / 轻量化网络 想改进注意力机制推荐优先阅读MALA → AST → ECA → CBAM → Synthesizer → DSFormer → Attention Surgery适合Transformer / ViT / CNN-Attention / 图像恢复 / 高光谱分类 / 视频扩散 想改进分割网络推荐优先阅读SMMM → EMCAD → MPD适合U-Net / 医学图像分割 / 语义分割 / 小目标分割 / Encoder-Decoder 想改进扩散模型 / 视频生成推荐优先阅读ControlNet-XS → AttriDiffuser → StreamingT2V → ByTheWay → Attention Surgery适合Stable Diffusion / ControlNet / Text-to-Video / Video Diffusion / 可控生成 想改进训练策略 / Loss推荐优先阅读DBM Loss → 两步保形预测 → 长尾数据集蒸馏 → 卷积层谱范数适合长尾分类 / 目标检测 / 不确定性估计 / 网络正则化 / 鲁棒训练 顶会论文方向快速索引CVPR / ICCV / ECCV / AAAI / ICML 等方向Attention SurgeryEgoPFGNetMALAFDConvLSNetARConvByTheWay长尾数据集蒸馏DCNv4ASTInceptionNeXtControlNet-XS两步保形预测SMMMDBM LossSCNetSynthesizerCBAM 代码实现 / 即插即用优先阅读如果目标是直接拿模块改网络建议优先阅读SCConv1d SCConv2d→ 适合直接替换普通卷积。ECA / CBAM→ 适合快速加入通道或空间注意力。DCNv4 / ARConv / FDConv→ 适合从卷积采样方式、动态卷积核方向进行创新。PartialNet / InceptionNeXt→ 适合轻量化 Backbone 与多尺度卷积设计。EMCAD / SMMM / MPD→ 适合分割网络 Decoder 与上下采样结构创新。MALA / Synthesizer / AST→ 适合 Transformer 与 Attention 结构创新。ControlNet-XS / StreamingT2V CAM / ByTheWay→ 适合扩散模型和视频生成模型的插件式改进。 后续更新本目录将持续更新。后续主要补充① 顶会 / 顶刊中的即插即用模块② 卷积、注意力、Transformer 的最新结构③ YOLO、U-Net、ResNet 等模型的模块替换方案④ 图像恢复、医学分割、遥感检测、生成模型等任务中的改进模块⑤ 各类模块的二次创新与组合改进思路如果对某个模块感兴趣可以直接通过本文目录跳转到对应文章。持续更新中……