团队引入 AIOps 前必须回答的三个问题你的数据质量怎么样你的告警分级规则定好了吗你的团队有人能判断 AI 给的结果对不对吗我是崔皓51CTO 学堂特级讲师精通 AI 相关开发。近几年我专注 AI 领域课程研发以及分布式技术具有 20 年 IT 项目开发经验以及教学经验。很多人都分享过 AIOps 的成功案例。今天我想聊一次翻车经历。去年我们团队搞智能告警上了动态阈值。当时的想法很美好 —— AI 自动学习历史数据、自动调整告警阈值终于不用人工一个个调参数了。PM 在项目启动会上画了个饼上了动态阈值告警量能降 50%误报率能降 70%。结果上线第一周告警量翻了快三倍。到底发生了什么不是真的出了更多故障。是新模型太敏感。动态阈值的工作原理是学习历史数据的模式然后判断当前波动是否异常。但我们的历史数据里本来就包含了很多正常的业务波动。双十一的流量峰值、每周五晚高峰、甚至每天凌晨的备份任务。模型学了这些异常模式之后把正常波动也当成了异常。最离谱的一次半夜两点。一个微服务 GC 时间稍微多了一点。正常情况这种波动持续 30 秒就恢复了没有任何影响。但动态阈值判定为严重异常连发十几条告警。告警太多又触发了升级PagerDuty 直接打了值班同事的电话。值班同事凌晨两点被叫起来排查了半个小时发现什么都没坏。第二天他跟我说哥这系统比以前的还难用。更惨的还在后面业务方也收到了告警通知。我们当时的告警通知同时推给运维和业务负责人。半夜炸了一波之后业务方的技术负责人直接发邮件给我们 VP抄送了整个技术部。最后项目被迫回退。团队士气跌到谷底。那个 PM 后来跟我说这是他职业生涯最接近被开除的一次。复盘我们到底错在哪复盘的时候我们一开始都在讨论技术问题。是不是模型选错了是不是历史数据不够是不是阈值窗口设太短后来我想明白了 —— 真正的问题不在技术上。是团队里没有人真正理解 AIOps 落地的逻辑。AIOps 不是一个工具装上就完事。它需要有人做三件事第一数据质量评估。你的历史数据够不够干净告警标记全不全误报有没有清理数据质量不行再牛的模型也是垃圾进、垃圾出。第二阈值与业务对齐。什么程度的告警该推给业务方什么程度运维内部处理就行不同业务线的容忍度一样吗这些规则不定义清楚AI 只会乱报警。第三人工兜底机制。AI 判断不了的场景怎么办AI 的判断出错了怎么快速纠正没有兜底AI 就是一个定时炸弹。这三件事不是算法工程师帮你做的。是运维人自己要搞清楚的。花了三十万买来的教训那次翻车之后我给自己定了一个规矩 —— 现在给别人推 AIOps 方案第一句话永远不是这个工具多厉害。而是你先告诉我你的数据质量怎么样你的告警分级规则定好了吗你的团队有人能判断 AI 给的结果对不对吗这三个问题能回答上来再谈工具。回答不上来先补课。这个教训花了公司差不多三十万的人力成本和时间成本。但它后来帮我避开了更多坑。现在回想起来 —— 值。但不是每个团队都有三十万可以拿来交学费的。所以我写出来希望你能省下这笔钱。