英文题目Predicting the Year of Total Knee Replacement: A Transformer-Based Multimodal Approach中文可译为全膝关节置换术年份预测一种基于 Transformer 的多模态方法发表于MIDL 2025即Medical Imaging with Deep Learning 2025。一、摘要膝骨关节炎发展到晚期后部分患者最终需要接受Total Knee Replacement, TKR但是临床上一个很重要的问题不是只有“这个患者以后会不会换膝”而是“大概还有几年需要进行膝关节置换”这个问题很难因为 TKR 决策不仅取决于影像学病变还受到疼痛程度功能受限年龄BMI合并症患者手术意愿影像学结构改变等多种因素共同影响。传统深度学习通常只使用 MRI或者少量临床变量因此信息不完整。作者提出一个端到端多模态模型将下面的内容共同输入模型MRIClinical VariablesMR Image Readings具体采用3D ResNet18提取 MRI 特征Pretrained TabNet提取表格数据特征然后通过 Cross-modal Attention完成两种模态之间的融合。最终预测 0,1,2,…,9即患者距离 TKR 还有多少年。实验表明完整模型取得 63.4% Accuracy优于MRI-onlyTabular-onlyConcatenationDAFT普通 Transformer 表格编码器二、创新点1 从“TKR风险预测”进一步走到“TKR具体年份预测”很多 OA 论文研究的是是否进展或者未来是否TKR属于二分类。本文则预测 0∼9年内具体哪一年接受TKR因此预测目标更细。例如模型输出 3意味着患者大约 3 年后接受 TKR。所以这篇论文实际上研究的是一种 Time-to-event Prediction只不过作者将时间离散化后作为多时间区间预测问题处理。2 MRI 临床数据 影像评分的多模态融合作者认为 TKR 不是由影像单独决定的。比如一个 KL4 患者如果没有明显疼痛可能暂时不会手术反过来一个 KL1 患者如果疼痛和功能受限非常严重也可能更早接受 TKR。因此仅看 MRI是不够的。论文同时使用MRIClinical VariablesImage Readings其中表格信息包括例如年龄BMIWOMACKLOARSIBML其他影像定量/半定量评分。因此模型不是单纯进行 Image→TKR而是Disease StructureSymptomsClinical Condition→TKR Time3 使用 Cross-modal Attention而不是简单拼接传统 multimodal fusion 常用 Image Feature⊕Tabular Feature直接 concatenate。本文则让两种模态通过 Cross Attention显式建立关系。也就是说模型可以学习哪些临床特征应该关注 MRI 中哪些区域或特征。而且作者特别设计为Tabular features作为QueryMRI features 作为 Key / Value。因为作者认为TKR 决策更直接受到患者症状和临床状态影响所以应该由临床信息主动“查询”影像中相关信息。三、方法整个方法可以拆成三个模块Image EncoderTabular EncoderMultimodal Interaction流程 MRI→3D ResNet18同时 ClinicalImage Readings→Feature Selection→Pretrained TabNet然后 Image FeaturesTabular Features↓Cross Modal Attention↓Year of TKR3.1 MRI Image Encoder作者使用的是Sagittal fat-suppressed 3D DESS MRI也就是 OAI 中常用的 3D DESS膝关节 MRI。Image Encoder 采用 3D ResNet18输入尺寸经过裁剪后为 300×300×160训练阶段 Random Crop验证阶段 Center Crop最终从最后一个 pooling layer 提取 MRI representation3.2 Self-supervised Pretraining Pretrained TabNet作者没有直接监督训练 TabNet而是先进行Masked Self-Supervised Learning思路类似 BERT。将一部分临床变量 Mask掉然后让 TabNet 根据剩下变量 Known Features恢复 Masked Features即Known Variables→Predict Missing Variables训练时 masking ratio 0.5也就是随机遮掉 50% 的变量。通过这种方式TabNet 可以提前学习临床变量之间的关联结构然后再 Fine-tune 到 TKR 预测。1、Tabular Data原始 OAI baseline clinical variables 一共有1224个。其中 245个变量在超过 90% 的受试者中可用。此外作者还使用了 全部可获得的影像评价指标所以表格数据包含两部分 Xt[Xc,Xr]其中XcClinical variablesXrImage readings。2、Tabular Representation经过 TabNet 后得到可以理解为由多个临床/影像变量组成的一组 tabular tokens。而 MRI 经过 ResNet 得到 I再通过 Linear使 image token 与 tabular token 拥有相同 embedding dimension。3.3 Multimodal Interaction Module核心融合模块ψ包括Self-AttentionCross-AttentionFeed ForwardLayer Normalization。一共有 4 Transformer Layers每层 8 Attention HeadsHidden dimension 64Cross-modal Attention公式为这里作者设置QTabular FeaturesK,VMRI Features也就是说 Clinical Information→Query去询问 MRI Information哪些影像信息对当前 TKR 时间最重要。这个设计很符合临床逻辑“这个患者痛得怎么样、功能怎么样、年龄是多少、已有影像评分怎么样”四、实验4.1 数据集使用OAI,Osteoarthritis Initiative。OAI 共 4796名受试者。研究中 547 subjects在 9 年随访期间接受过 TKR。最终综合MRIClinical dataquantitative image assessmentssemi-quantitative image assessments筛选出 850 knees用于实验。还包含丰富的临床变量例如WOMAC Pain不同疼痛等级。OARSI Grade包括NoneSmallMediumLarge。BML作者将膝关节分为15个 BML subregions。统计其中存在损伤的区域数量。因此这不是简单 MRI年龄BMI而是包含相当多OA-specific clinical and imaging features。4.2 结果MRI-onlyACC60.7%MAE 1.46Macro-AUC 0.615Tabular-only预训练 TabNetACC61.0%MAE 1.55说明单独临床影像评分数据已经和MRI差不多再次说明 TKR 是一个临床决策而不只是影像学严重程度症状 功能 结构共同决定最终完整模型ACC63.4% MAE1.33 years Macro-AUC0.665是所有方法中最优。五、总结什么时候换膝不是单纯由 MRI 决定的因此模型不应该只“看膝盖”而应该同时知道患者痛不痛、功能怎么样、影像评分如何再让这些临床信息主动去 MRI 中寻找与手术时间相关的结构证据。所以整个思想可以压缩为“膝盖长什么样”“患者现在是什么状态”→“还有几年需要换膝”而从 OA 人工智能研究路线来看这篇论文已经明显从传统的 分割→KL分级进一步走到了 个体化预后→临床事件时间预测这类问题与真正的临床决策支持更接近。