摘要本文解读 CVPR 2025 论文《MMRL: Multi-Modal Representation Learning for Vision-Language Models》。该论文提出多模态表示学习MMRL框架通过融合共享可学习表示空间、表示 token 高层注入与类 token 余弦正则在少样本16-shot条件下既提升任务适配精度又保住预训练泛化能力其特别之处在于训练与推理的解耦策略表示 token 学任务、类 token 保泛化。实验表明11 个数据集 base-to-novel 调和平均达到 81.20基类精度 85.68全面刷新 SOTA且 ImageNet 16-shot 训练仅需 3.6 分钟为视觉语言模型的高效迁移学习提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机为什么 CLIP 少样本适配会过拟合研究主线从问题到结论基准/方法设计一个空间两个模态分类全景VLM 高效适配的三条路线方法细节解耦训练与推理实验设计与结果四项评测全部 SOTA结果对比总结关键发现局限性常见问题FAQMMRL 和 MMA 有什么区别为什么表示 token 只注入高层编码器解耦策略在推理时如何工作MMRL 需要多少训练资源MMRL 的代码开源了吗MMRL 的主要局限是什么参考链接论文基本信息项目内容标题英文MMRL: Multi-Modal Representation Learning for Vision-Language Models标题中文多模态表示学习让 CLIP 少样本适配不再过拟合作者Yuncheng Guo, Xiaodong Gu机构复旦大学电子工程系会议CVPR 2025arXivhttps://arxiv.org/abs/2503.08497项目网站https://github.com/yunncheng/MMRL背景与动机为什么 CLIP 少样本适配会过拟合大规模预训练的视觉语言模型VLM如 CLIP用 4 亿图文对做对比学习具备强大的零样本能力。但把它迁移到下游任务时训练数据往往很少每类仅 16 张图于是出现一对矛盾适配得越用力过拟合越严重零样本泛化损失越大。现有适配路线主要有两条都有共同的隐含假设——只优化类 token 特征提示学习CoOpIJCV 2022把手工模板换成可学习连续向量CoCoOpCVPR 2022用视觉线索生成实例级提示MaPLeCVPR 2023在多个层同时加图文提示PromptSRCICCV 2023加自正则约束。问题深层提示从文本侧映射视觉本质仍是文本中心少样本下基类涨点但新类掉得厉害CoOp 的 Novel 精度从零样本 74.22 掉到 63.22。适配器风格CLIP-Adapter、Tip-Adapter 在输出端加轻量 MLPMMACVPR 2024把跨分支特征聚合到共享空间允许梯度跨模态流动。问题只在输出端做特征聚合编码器内部没有真正的跨模态交互。从历史视角看这条技术线从 CLIP2021确立零样本基线到 CoOp/CoCoOp2022开创提示学习再到 MaPLe/PromptSRC/TCP2023–2024走向深层多模态提示与共享特征空间始终没有跳出改输入提示或改输出特征的框架。MMRL 的答案是在编码器内部建一个共享可学习表示空间让双模态在深层语义层真正交互。研究主线从问题到结论图 5MMRL 研究主线流程图Mermaid——问题、动机、设计、方法、实验、结论基准/方法设计一个空间两个模态MMRL 维护一个共享、可学习、模态无关的表示空间$\mathcal{R}$里面放 $K$ 个高斯初始化的空间 token默认 $K5$维度 $d_r512$通过两个线性映射函数 $\mathcal{F}$ 分别投影成图像表示 token 和文本表示 token。从第 $J6$ 个 Transformer 层开始这些 token 被拼进冻结的 CLIP 编码器序列——低层保持纯净以保留通用视觉/文本知识高层注入任务特定表示。训练时只优化三部分表示空间 $\mathcal{R}$、映射函数 $\mathcal{F}$、表示 token 的 patch 投影层整个预训练 CLIP 完全冻结。文本编码器是自回归结构因此还要调整注意力掩码以容纳更长的 token 序列。图 1MMRL 训练框架共享表示空间经线性映射注入图文编码器高层C 类 tokenB/EOT 文本边界R 表示 token分类全景VLM 高效适配的三条路线图 6VLM 高效适配三路线分类图Mermaid——提示学习 / 适配器 / 表示学习方法细节解耦训练与推理MMRL 的核心是解耦策略让学任务和保泛化各司其职训练阶段表示特征走可训练投影层类特征走冻结投影层分别计算交叉熵损失 $\mathcal{L}_c$ 与 $\mathcal{L}_r$同时用余弦正则把类特征 $(f_c, w)$ 拉向冻结 CLIP 特征 $(f_0, w_0)$。总损失为 $\mathcal{L} \alpha \mathcal{L}_c (1-\alpha) \mathcal{L}_r \lambda(\mathcal{L}_v \mathcal{L}_t)$默认 $\alpha0.7$ImageNet 上 $\lambda0.5$。基类推理训练见过的类别融合两种特征 $p(y|x) \alpha p(y|f_c) (1-\alpha) p(y|f_r)$——任务特定知识与通用知识互补。新类推理未见过的类别只用类特征 $p(y|f_c)$——因为表示 token 学的是数据集特定分布直接用于新类会过拟合。图 2MMRL 推理过程不同任务使用不同特征base 类融合、novel 类仅类特征实现细节ViT-B/16 骨干AdamW 优化器学习率 $10^{-3}$混合精度训练ImageNet 上 batch size 32、5 个 epoch其余数据集 batch size 4、10 个 epoch三次运行取平均全部实验单张 RTX 4090 完成。实验设计与结果四项评测全部 SOTA实验覆盖四类评测默认 16-shotbase-to-novel11 个数据集类别对半切分、跨数据集ImageNet 1000 类训练后直接用到其余 10 个数据集、域泛化ImageNet → V2/Sketch/A/R、少样本每类 1/2/4/8/16 shot。base-to-novel 平均结果主表方法BaseNovelHMCLIP零样本69.3474.2271.70CoOp82.6963.2271.66MaPLe82.2875.1478.55PromptSRC84.2676.1079.97MMA83.2076.8079.87MMRL本文85.6877.1681.20MMRL 在平均 Base2.48pp、Novel0.36pp、HM1.33pp三项全面超过上一 SOTA MMA11 个数据集的调和平均全部最佳——雷达图完整包裹所有基线。值得注意的是 CoOp 基类 82.69 但新类只有 63.22说明只优化类 token 的提示方法过拟合严重MMRL 在两者间取得最佳平衡。图 3少样本学习对比MMRL 在全部 shot 设置1/2/4/8/16下平均精度最高且随 shot 数增多优势扩大跨数据集ImageNet 源域 72.031.03pp 超 MMA10 个目标数据集平均 67.25 为最高。域泛化ImageNet-V2 64.47、ImageNet-A 51.20 两个偏移集取得最佳。少样本全部 shot 设置平均精度最高且 shot 数越多优势越大。图 4消融实验左——表示 token 注入层位置 J右——表示 token 数量 K附录消融细节全部在 11 数据集 base-to-novel 上平均注入层 $J6$ 最优——过低如第 2 层基类精度明显下降说明低层特征不可适配过高则可学习参数减少、容量不足。token 数 $K5$ 最优过多导致新类精度回落。表示维度 $d_r512$ 最优EuroSAT 用 2048继续增大出现过拟合。$\alpha$ 扫描 0.0→1.0 中 0.7 最优HM 81.20两端分别掉到 77.29 和 79.42$\lambda$ 在 ImageNet 上 0.5 最优HM 74.45。正则策略对比中余弦正则81.20显著优于 L180.47与 MSE79.53因为余弦约束更松弛类 token 保泛化的同时仍能捕捉任务知识。附录 A 计算开销ImageNet 16-shot单张 RTX 4090方法可训练参数训练(ms/图)FPSHMMaPLe3.555M39.51757.678.55PromptSRC0.046M40.01764.279.97ProVP0.147M4.4928.978.76TCP0.332M5.3950.679.51MMA0.675M2.2688.579.87MMRL4.992M5.3762.481.20MMRL*$d_r32$0.689M5.3767.880.84MMRL 整轮 ImageNet 16-shot 训练仅 3.6 分钟把 $d_r$ 压到 32 后参数与 MMA 持平0.689MHM 仍有 80.84说明成本可按需压缩。结果对比总结图 7结果对比总结图Mermaid——CLIP 71.70 → CoOp 71.66 → MMA 79.87 → MMRL 81.20关键发现解耦策略是收益核心去掉解耦只用类特征w/o DS₁基类精度从 85.68 掉到 83.59只用表示特征$\alpha0$HM 掉到 77.29。双模态交互不可或缺仅图像侧w/o LHM 80.08、仅文本侧w/o VHM 78.74都比双模态联合的 81.20 低——共享空间必须同时服务两个编码器。效率与性能可兼得4.99M 参数、5.3 ms/图训练、762 FPS 推理HM 81.20压缩到 0.689M 参数仍有 80.84优于同规模的 MMA79.87。少样本优势随数据扩大1-shot 平均 72.67、16-shot 平均 85.08 附近的全 shot 最佳表现说明表示学习能有效利用每一张新增样本。跨域迁移稳健ImageNet 训练直接迁移到 10 个目标数据集平均 67.25域泛化 4 个偏移集拿下 2 个第一。局限性实验只在 CLIP ViT-B/16 一个骨干上验证未覆盖更大模型或其他 VLM如 SigLIP、EVA-CLIP。可训练参数 4.99M 明显高于 MMA 的 0.675M压缩到 $d_r32$ 虽有缓解仍非零成本。表示维度、注入层、$\alpha$、$\lambda$ 等超参数需要按数据集微调如 EuroSAT 用 $d_r2048$。Novel 精度并非每个数据集都最高FGVCAircraft 上落后 PromptSRC 0.84pp但基类高 3.57pp。作者展望更参数高效的表示学习与模态内交互即后续工作 MMRLIJCV 2026。常见问题FAQMMRL 和 MMA 有什么区别MMA 在输出端把跨分支特征聚合进共享空间本质是特征融合MMRL 在编码器内部第 6 层起注入可学习的表示 token让图文双模态在深层 Transformer 中真正交互并且用解耦策略分开优化表示特征与类特征。为什么表示 token 只注入高层编码器低层编码器保存的是通用、可迁移的视觉/文本知识注入任务特定 token 会破坏它们高层特征本身偏数据集特定、可塑性强。消融显示注入层太低时基类精度明显下降第 6 层是最佳折中。解耦策略在推理时如何工作对训练见过的基类融合类特征与表示特征的概率$\alpha0.7$ 加权对未见的新类只用类特征。因为表示 token 学的是数据集特定分布直接用于新类会过拟合而类特征被余弦正则约束在预训练特征附近保留了零样本能力。MMRL 需要多少训练资源单张 RTX 4090 即可完成全部实验。ImageNet 16-shot 整轮训练约 3.6 分钟每张图训练 5.3 毫秒推理 762 FPS。MMRL 的代码开源了吗开源了。官方实现位于 github.com/yunncheng/MMRL并包含延伸工作 MMRL。MMRL 的主要局限是什么骨干单一仅 CLIP ViT-B/16、可训练参数偏高4.99M vs MMA 0.675M、超参数需按数据集调以及新类精度并非处处最高。参考链接arXiv 摘要页https://arxiv.org/abs/2503.08497官方代码含 MMRLhttps://github.com/yunncheng/MMRLCLIPICML 2021https://arxiv.org/abs/2103.00020CoOpIJCV 2022https://arxiv.org/abs/2109.01134MaPLeCVPR 2023https://arxiv.org/abs/2210.03117MMACVPR 2024https://arxiv.org/abs/2405.16904给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件