三阶十二步工业AI小模型训练实战 · 第11篇 工业特征怎么造:从原始信号到稳定、可解释的模型输入每个特征都要回答:为什么有用、预测时能否获得、线上如何一致计算作者:黄山 | 专栏序号:11 / 30 | 阅读时间:约25分钟图1 特征工程不是在表格里批量造列,而是把设备机理、传感器测量链和老师傅的判断依据,翻译成模型能够稳定使用的数字证据。文章摘要|第10篇解决了训练数据如何在物理边界内扩充,第11篇进入模型输入层:如何把振动、温度、电流、工况和事件日志转化为可解释、可复现、可上线的特征。文章先建立特征契约与测量链门禁,再梳理统计、时域、频域、工况和机理特征,说明转速负载归一、训练折内筛选、冗余与稳定性审计、未来信息泄漏,以及训练与推理一致性。最终给出特征注册表、监控指标和七步验收流程。核心不是“提了多少列”,而是“每一列是否有证据、在预测时可得,并在最差工况下仍然稳定”。写在前面:特征是工业知识的数字接口工业现场经常出现一个反差:传感器很多、数据量很大,模型却迟迟达不到可用水平。原因往往不是算法不够复杂,而是原始量没有被转换成与故障机理、工艺状态和业务决策对齐的证据。深度学习可以从原始波形中学习表示,但小样本、边缘算力、长尾故障和解释要求,决定了工业项目仍需要高质量特征工程。原稿中的纺织设备案例很典型:老师傅把轴承异常描述为“声音变尖、手感有冲击、温度比平常高”。把这三句话翻译为高频能量占比、冲击因子和温升斜率后,模型召回率从62%提升到89%。真正产生价值的不是某个公式,而是从现场语言到物理假设、再到可计算变量的翻译链路。核心原则|一个可上线特征至少要有五张身份证:业务假设、数据来源、可用时刻、计算版本和质量状态。缺少任何一项,重要性再高也只是实验室变量。一、先写特征契约:每一列为什么存在不要从`df.columns`开始特征工程,而要从预测问题开始。对每个候选特征,先写清楚它要捕捉的机理、在预测时刻之前是否可获得、使用什么原始测点和时间范围、单位和有效范围是什么、缺失或越界如何处理、线上由谁计算。这样可以在建模之前淘汰目标代理、事后字段和无法部署的想法。契约字段必须回答的问题示例失败风险业务假设它与故障或质量结果有何机理关系冲击增加→滚动体局部损伤相关但不可解释可用时刻预测时能否完整获得;允许多大延迟告警时刻前30 s已落库未来信息泄漏来源与单位测点、通道、标定、单位和方向驱动端径向加速度,g同名不同量纲计算定义窗口、公式、参数、无效值和版本RMS;去直流;v2.1离线线上不一致质量状态何时有效、何时降级或拒绝有效采样率≥98%坏传感器被当故障特征名中写清对象、测点、统计量和单位,例如`de_bearing_acc_rms_g`,不要使用`x17`或`temp2`。同一物理量从PLC、数据库和边缘网关读取时,必须确认缩放系数、符号、时区和采样语义一致。原始列、清洗规则、中间量和最终特征形成有向谱系,任何预测都能追到原始记录。