医学论文解读:Divide-and-conquer towards optimal adaptation of pre-trained model to medical tasks
期刊Pattern Recognition年份2026英文题目Divide-and-conquer towards optimal adaptation of pre-trained model to medical tasks中文可译为面向医学任务预训练模型最优适配的分而治之方法一、摘要医学影像分析普遍存在人工标注不足的问题因此大规模预训练模型常被用于医学任务迁移。但由于Natural ImagesMedical Images自然图像预训练得到的所有参数并不是对医学任务都同样重要。现有微调方法例如Full Fine-TuningAdapterLoRAVPTSSFBitFitSPTGPS虽然能够在一定程度上提高效率但仍然没有真正解决两个关键问题问题一到底有多少预训练参数对医学任务是真正关键的问题二到底应该更新哪些参数哪些参数应该保持稳定作者首先利用Correlation-Aware PruningCAP分析MAE预训练模型中的参数重要性。他们把如果移除某个参数会导致下游任务损失显著增加的参数定义为Fundamental Parameters即基础参数。实验发现约10%参数是fundamental而且这些参数在X-rayCTdermoscopyorgan classificationknee OA grading等不同医学任务中具有非常高的重叠度。与此同时作者发现如果把这10%的关键参数固定只更新剩余90%参数反而比全参数微调效果更好。因此作者进一步提出Divide-and-Conquer Fine-Tuning具体做法是对约90%的非基础参数正常更新对约10%的基础参数不完全冻结而是把梯度乘一个很小的惩罚系数只允许轻微调整。最终在多个医学分类任务以及一个医学分割任务中都优于全参数微调和多种PEFT方法。二、创新点创新点一提出“基础参数”和“非基础参数”的划分思想这是整篇论文最核心的思想。作者认为一个大型预训练模型中的参数并不是同等重要的。定义Fundamental Parameters如果移除这类参数Loss Significant Increase说明这些参数包含跨任务、较稳定、通用的视觉知识。而Non-fundamental Parameters移除后对当前任务损失影响较小说明这些参数并没有被预训练模型充分锁定可以进一步用于适配具体医学任务。最终作者把整个预训练模型拆成10% Fundamental90% Non-fundamental​这就是“Divide”的来源。创新点二发现约10%的关键参数在不同医学任务中高度重叠作者并不是简单说每个任务都有自己10%的重要参数。而是进一步发现不同医学任务所对应的关键参数位置高度一致。论第4页 Fig.3 中计算了多个任务之间的Fundamental Parameter Overlap不同任务之间的重叠度基本都在 0.988∼0.993附近。涉及RSNAOSACheXpertNIH-CXR-LTDermaMNISTOrganAMNIST。这说明 这些关键参数很可能具有Task−Agnostic性质​即它们不是专门服务于肺部、膝关节或皮肤而是在预训练中已经学到了非常通用的视觉结构信息。创新点三证明关键参数应“保持稳定”非关键参数才应该充分更新作者做了一个很重要的实验分别尝试只更新基础参数只更新非基础参数更新全部参数。结果发现更新90%非基础参数冻结10%基础参数​效果最好。这说明基础参数并不是“最应该训练”的参数反而是“最不应该乱动”的参数。因为这些参数已经通过大规模预训练落在了一个比较好的位置。如果全参数微调θfundamental​可能发生较大漂移导致预训练过程中学到的通用能力被破坏。创新点四提出梯度加权而不是完全冻结关键参数作者进一步认为完全冻结基础参数 Gradient0虽然能保护预训练知识但也不一定是最优。因为医学域和自然图像域仍然存在差异。所以提出其中 0β≪1让基础参数可以适当调整但变化很小。与此同时正常更新。因此最终实现保护通用能力充分学习医学任务特征​这就是“Conquer”的核心。三、方法整个方法其实可以清楚地分成两个阶段Parameter Partition→Gradient Weighting​3.1Parameter Partition1、第一步准备预训练模型论文主要采用MAE即Masked Autoencoder作为预训练模型。具体为MAEViT−B/16其预训练数据来自130万张自然图像。MAE的预训练任务是遮住一部分patch再重建完整图像。作者认为这种无监督重建任务能够让模型学习形状显著区域长程空间关系等比较通用的信息。2、第二步先接一个下游任务分类头假设预训练MAE encoder为在其后增加一个随机初始化的Linear Classification Head得到 x→MAE Encoder→Classifier→y此时利用下游医学数据D来判断哪些预训练参数真正影响当前医学任务。3、第三步利用CAP评估参数重要性作者采用Correlation-Aware PruningCAP进行参数重要性评估。基本思想是如果删除一个参数以后下游任务loss变化很小那么这个参数不重要。反过来如果删除以后loss明显上升那么这个参数就是关键参数。作者利用loss对参数的二阶近似来估计参数删除带来的影响因为直接计算Hessian逆矩阵成本太高所以进一步使用Fisher Information近似Hessian。最终得到每个参数的重要性。4、生成Binary Mask最终得到所以M就是整个模型的Parameter Importance Mask。作者通过实验搜索不同Sparsity Rate例如 10%,30%,50%,70%,90%,100%。这里的sparsity rate表示允许更新的非基础参数比例。3.2Gradient Weighting1、重新初始化分类头前面的分类头只是为了分析参数重要性。完成CAP以后作者重新加载原始MAE权重并重新初始化classification head。所以真正的下游训练是从Original Pretrained MAE开始而不是从剪枝后的模型开始。CAP只是找参数位置​而不是真正删除参数。2、Divide-and-Conquer梯度更新真正微调时对所有参数仍然计算梯度。但是不同参数采用不同梯度强度。对于Non-fundamentalMi​0正常更新。对于FundamentalMi​1梯度乘β变成。所以总公式其中η是learning rate β是Penalty Factor。β0代表完全冻结基础参数。β1代表全参数正常微调。作者发现最佳值往往非常小。3.3 下游任务数据集作者一共验证了7类下游任务/数据设置。主要分类任务包括RSNA胸部X-raynormallung opacityabnormal without opacity。CheXpert胸部X-ray疾病分类。NIH-CXR-LT胸部疾病分类。OSAKnee Osteoarthritis Severity Grading Dataset膝骨关节炎严重程度分级。数据共5778张膝关节X-ray。分为 3个严重程度等级。每个等级使用 300张作为训练集。DermaMNIST皮肤镜疾病分类。OrganAMNIST腹部CT器官分类。以及Synapse腹部CT多器官分割。四、结论本文首先利用Correlation-Aware Pruning分析预训练模型参数对医学下游任务的重要性发现约10%的参数是跨任务高度重叠的基础参数它们承载预训练模型的通用视觉能力并主导良好收敛因此提出Divide-and-Conquer微调策略对这10%的基础参数仅施加很小的梯度进行轻微调整而对其余90%的非基础参数正常充分微调从而在保护预训练通用知识的同时实现对具体医学任务的有效适配并在膝OA分级、胸部X-ray、CT、皮肤镜分类和多器官分割等任务上优于全参数微调及多种PEFT方法。