摘要本文解读 CVPR 2025Highlight论文《ImagineFSL: Self-Supervised Pretraining Matters on Imagined Base Set for VLM-based Few-shot Learning》。该论文提出ImagineFSL一种基于想象基集iBase自监督预训练的 CLIP 少样本学习新范式通过融合高阶矩表示HoM-DINO、掩码图像建模MIM与思维链上下文学习合成管线CoTICL先把合成图像当作独立知识仓库进行预训练再在少样本任务上微调其特别之处在于把文生图补充升级为独立知识仓库。实验表明11 个数据集全面刷新 SOTA少样本平均 79.9%、16-shot 84.4%、LoRA 变体 87.6%为数据稀缺场景下的视觉语言模型适应提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机少样本学习的数据稀缺困境为什么合成图当补充不是最优解研究主线从问题到结论基准/方法设计两阶段架构预训练 微调关键发现自监督优于监督分类全景方法细节HoM-DINO为少样本定制的自监督目标可扩展合成管线CoT ICL实验设计与结果评测协议合成图方法对比1/16-shot 平均精度 %仅用真实图的 K-shot 对比平均精度 %域泛化、零样本与效率关键消融1/16-shot 平均 %结果对比总结关键发现局限性常见问题FAQImagineFSL 与 DISEF、DataDream 有什么区别为什么自监督预训练优于监督预训练HoM-DINO 比 DINO 强在哪里合成图像质量对结果影响大吗ImagineFSL 需要多少额外参数本论文有 arXiv 预印本吗参考链接论文基本信息项目内容标题英文ImagineFSL: Self-Supervised Pretraining Matters on Imagined Base Set for VLM-based Few-shot Learning标题中文想象基集上的自监督预训练VLM 少样本学习作者Haoyuan Yang, Xiaoou Li, Jiaming Lv, Xianjun Cheng, Qilong Wang, Peihua Li机构大连理工大学 · 北京邮电大学 · 天津大学会议CVPR 2025HighlightarXiv无本论文无 arXiv 预印本项目网站https://peihuali.org/ImagineFSL背景与动机少样本学习的数据稀缺困境少样本学习FSL旨在从极少量标注样本中识别新概念一直是计算机视觉的热点。然而FSL 面临的根本矛盾是标签数据稀缺标注成本高、长尾类别样本少CLIP 等视觉语言模型VLM虽有零样本能力但在少样本场景下仍受数据不足制约。为什么合成图当补充不是最优解近年来文生图T2I模型可以生成海量逼真的标注图像看似为 FSL 提供了数据出路。但现有方法存在系统性局限DISEFarXiv:2312.03046用 LLaVA 描述少样本真实图再输入 T2I 生成配合 LoRA 微调DataDreamECCV 2024用真实图微调 T2I 模型为每个数据集定制生成器IsSynthICLR 2023用 T5 生成多样化描述。这三类方法有一个共同问题只把合成图当作真实图的补充直接混合进微调阶段。论文作者指出合成图来自独立基础模型LLMT2I应被当作独立的知识仓库而非附属品——这正是 ImagineFSL 的核心动机。研究主线从问题到结论图 1ImagineFSL 研究主线从数据稀缺问题到自监督预训练范式再到全面 SOTA。基准/方法设计两阶段架构预训练 微调ImagineFSL 的核心是两阶段 CLIP 适应预训练阶段在纯合成图像基集iBase上用自监督方法HoM-DINO训练适配器学生-教师双分支 EMA冻结 CLIP 图像编码器微调阶段保留教师适配器丢弃头部与学生分支附加视觉V分类器与视觉-语言VL分类器损失为 $L_V L_{VL}$推理时按融合权重平均 logits。图 2HoM-DINO 自监督预训练SyntAug 构造正对高阶矩表示 掩码图像建模双头EMA 教师更新。关键发现自监督优于监督论文通过消融证实相比无预训练监督预训练SL与自监督预训练Self-SL都有益但 Self-SL 显著更好1-shot/16-shot 平均 2.3%/1.1%。这意味着从合成域到真实域的表示迁移自监督学习学到的特征更具泛化性。图 3少样本微调阶段视觉与视觉-语言双分类器联合训练LoRA 进一步微调图像编码器。分类全景图 4CLIP 适应方法谱系ImagineFSL 开辟先在合成基集预训练、再微调的两阶段范式。方法细节HoM-DINO为少样本定制的自监督目标DINO 只看 [CLS] token忽略了 patch token。HoM-DINO的关键创新是建模patch 分布的高阶矩表示 $r \phi\circ\theta(x) \triangleq [\text{CLS};\ m_1;\ m_2;\ m_3]$4p 维其中 $m_1$ 为分布中心$m_2$、$m_3$ 为归一化的二阶、三阶矩SyntAug同一 caption 由 T2I 生成的两张合成图构成正对语义一致且自然多样优于手工增强MIM随机掩码 patch学生重建教师预测强化 patch 级判别总损失 $L L_{\text{HoM}} L_{\text{MIM}}$均为 KL 散度自蒸馏无负样本、无大 batch 依赖。可扩展合成管线CoT ICL合成数据从哪来论文设计了系统性管线GPT-4 思维链CoT分析识别五个图像描述因子——属性attribute、视角viewpoint、背景BG、光照LC、退化原因CD设计四种描述模式Llama 3 8B 上下文学习ICL以 GPT-4 示例为上下文本地大规模扩写描述温度 0.5、核采样 0.7Stable Diffusion 3 Medium 出图构建 SyntIN1KImageNet-1K 类名每概念 300 描述 × 4 图基集。图 5合成管线CoT 提升保真度FID 40.1→32.6ICL 保证多样性1.06→1.21。实验设计与结果评测协议在11 个基准数据集ImageNet、Caltech、Aircraft、Cars、Food、Pets、Flowers、DTD、EuroSAT、SUN、UCF101上评测少样本与零样本识别域泛化用 ImageNet 训练 16-shot测试 V2/Sketch/A/R 四个目标集。每数据集采样 3 个 All-way-K-shot 任务取平均精度主模型为 CLIP ViT-B/16。合成图方法对比1/16-shot 平均精度 %方法类型1-shot16-shot平均IsSynth补充合成图73.881.777.8CaFo补充合成图71.581.776.6DISEF补充LoRA--85.1--DataDream微调T2I--87.0--ImagineFSL两阶段75.884.180.0ImagineFSL$_{LoRA}$两阶段LoRA77.387.582.4共享同一批合成数据时ImagineFSL 平均超复现基线2.0%LoRA 变体 16-shot 达87.5%全面超过 DISEF85.1与 DataDream87.0。仅用真实图的 K-shot 对比平均精度 %方法1-shot2-shot4-shot8-shot16-shotCoOp67.670.874.076.880.0PromptSRC72.375.378.480.782.9CLIP-LoRA72.575.577.480.383.0GalLoP72.876.479.182.284.5ImagineFSL76.177.579.482.284.4ImagineFSL$_{LoRA}$77.679.181.984.287.6少样本越多优势越大1-shot 超 CLIP-LoRA3.6%16-shot 1.4%LoRA 变体各 shot 全面领先平均超第二名 GalLoP3.1%。域泛化、零样本与效率域泛化16-shotImagineFSL / LoRA 平均62.7% / 63.2%刷新 IN-Sketch53.8%与 IN-R80.0%双 SOTA零样本识别平均72.3% / 73.0%超 DMN70.51.8%/2.5%LoRA 在 11 个数据集中 7 个第一训练效率LoRA 变体训练2 倍快265ms vs DISEF 544ms、显存减半11.8G vs 20.6G参数仅占 5.89%。关键消融1/16-shot 平均 %设置1-shot16-shot无预训练真实图58.175.6无预训练混合合成图62.276.5监督预训练SL63.176.8HoM-DINOSelf-SL65.477.9Self-SL 方法对比DINOv263.3/77.2、SynCLR64.4/77.4、MAE61.9/76.3、HoM-DINO65.4/77.9——HoM-DINO 全面胜出。结果对比总结图 6三大评测维度的提升幅度少样本 3.1%、零样本 2.5%、自监督对比 2.1%。关键发现视角转变带来范式级提升把合成图从补充升级为独立知识仓库 iBase少样本平均精度达79.9%全面超越单阶段方法自监督预训练 监督预训练HoM-DINO 在 1-shot/16-shot 超 SL2.3%/1.1%合成到真实域的迁移性更强HoM-DINO 超越主流自监督方法超 DINOv22.1%/0.7%、SynCLR1.0%/0.5%、MAE 显著高阶矩 MIM SyntAug 三者缺一不可合成管线可扩展且高质量CoT 把 FID 从 40.1 降到32.6多样性从 1.06 提升到1.21轻量且高效仅5.08% 额外参数适配器即可刷新 SOTALoRA 变体训练速度快2 倍、显存减半随模型规模扩展换 ViT-L/14 后 1-shot 精度5.9%72.8%方法对大 CLIP 模型有持续增益。局限性预训练开销SyntIN1K 预训练约9 小时 / 4 张 RTX 4090ViT-B/16ViT-L/14 约 40 小时——虽然一次训练多任务复用仍有成本门槛合成描述未充分利用冻结编码器下数据规模增大出现性能饱和0.3M→0.45M 提升趋缓合成文本知识的潜力尚未挖尽依赖生成模型质量GPT-4 与 Llama 的生成质量直接决定合成数据上限闭源模型有成本与可复现性考量。作者展望换用更大 CLIP 模型带来显著增益合成数据在数据稀缺任务上值得进一步探索。常见问题FAQImagineFSL 与 DISEF、DataDream 有什么区别区别在于范式。DISEF、DataDream 是单阶段方法把合成图直接混入微调ImagineFSL 是两阶段方法先在纯合成基集 iBase 上自监督预训练适配器再微调下游任务把合成图当作独立知识仓库。为什么自监督预训练优于监督预训练监督预训练用类标签训练学到的特征偏向于区分 iBase 类别自监督预训练HoM-DINO学习通用的分布统计与局部结构从合成域到真实域的表示迁移性更强实验上 1-shot/16-shot 分别高2.3%/1.1%。HoM-DINO 比 DINO 强在哪里DINO 只用 [CLS] tokenHoM-DINO 额外建模patch token 分布的一/二/三阶矩并用掩码图像建模强化 patch 级判别用SyntAug同一 caption 的两张合成图构造视图——三者组合让它在 1-shot/16-shot 上超 DINOv22.1%/0.7%。合成图像质量对结果影响大吗非常大。论文用 CoT 思维链优化描述生成FID 从 40.1 降到32.6、多样性从 1.06 升到1.21更好的合成数据直接带来更优的少样本性能这也是管线设计GPT-4 分析因子 Llama 扩写的核心价值。ImagineFSL 需要多少额外参数基础版只需在冻结 CLIP 编码器上附加适配器参数占编码器总参数的5.08%LoRA 变体额外微调图像编码器占 5.89%训练速度仍比 DISEF/DataDream 快2 倍、显存减半。本论文有 arXiv 预印本吗没有。ImagineFSLCVPR 2025 Highlight无 arXiv 预印本官方项目网站为 https://peihuali.org/ImagineFSL注意 arXiv:2312.03046 是另一篇论文 DISEF不要混淆。参考链接项目网站https://peihuali.org/ImagineFSLDINO 自监督学习Caron et al., ICCV 2021https://arxiv.org/abs/2104.14294DISEFDiversified In-domain SynthesisarXiv:2312.03046https://arxiv.org/abs/2312.03046DataDreamECCV 2024https://arxiv.org/abs/2403.18807SynCLRTian et al., CVPR 2024https://arxiv.org/abs/2401.13868Tip-AdapterECCV 2022https://arxiv.org/abs/2111.03930给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件