)
第五篇 特征工程 —— 从原始时序到模型输入5.1 特征工程在 EHR 预测中的地位与设计原则5.1.1 数据决定上限,特征逼近上限在机器学习界有一句流传甚广的箴言:“数据和特征决定了模型性能的上限,而算法只是在逼近这个上限。” 这句话在电子健康记录(EHR)分析中尤其真实。MIMIC-IV 提供了数万条 ICU 停留记录,但原始表格中的一行行时间戳测量值,如果不经过精心的特征工程,就无法转化为模型能够学习的知识。一个好的 EHR 特征工程流水线,应当做到以下三点:信息保真:尽可能保留临床相关信号,包括极端值、变化趋势和缺失模式。时间安全:防止未来信息泄漏到特征中,确保预测时点之前的可用数据才是合法的。可解释性:特征本身应具有临床可读性(如“入 ICU 24h 内乳酸最大值”),便于 SHAP 解释和临床沟通。我们的项目已经通过 SQL 提取了观察窗口内的原始聚合值(如lactate_max_24h、hr_mean_24h),现在需要在此基础上进行二次加工:衍生比率、评分、类别