AI时代软件工程难题待解:快手RCA Agent探索复杂业务排障实践
背景AI时代软件工程难题待解在AI coding工具日益成熟的今天代码生成能力已接近攻克但软件工程的全局难题远未解决。本文整理自快手资深服务端架构师郭勇良在QCon全球软件开发大会2026北京站的分享《复杂业务场景下RCA Agent的探索实践》。痛点排障成生产力瓶颈Claude Code负责人Boris Cherny曾提出编码工作大体上已被AI攻克可软件工程真的被解决了吗从2025年DORA报告和微软内部调研来看答案是否定的。AI Coding落地后个人效能提升显著但组织效能提升有限开发和排障仍是研发人员时间占比最大的两块。OpenClaw今年三月版本重构后大量用户反馈插件问题且其代码多由AI Coding生成这意味着AI排障可能从可选项变为必选项。业务层故障特点技术系统大致分三层业务层故障直接面向核心指标下跌等问题。业务层有三个显著特点是用户体验和营收的直接体现业务代码迭代极快高度易变业务问题无法预测排查步骤。业务场景落地挑战实际落地中面临四个层层递进的核心挑战。挑战一如何让AI理解业务主站某次用户Feed流请求量上涨根因是推荐质量下降。但故障传播链复杂传统监控三板斧存在断点只能依赖人工沟通。要让Agent理解业务需引入业务代码GIT最初用Claude Agent SDK分析代码库时间长切换到PI Coding Agent后虽有改善但仍有效率瓶颈。我们建立“业务资产”通过离线沉淀和排障中按需生成两种模式消除人和AI之间的上下文代差。挑战二如何对抗噪声告警噪声占比可能超75%会导致值班人员告警疲劳。让AI全量处理告警成本高、交互次数不可控、延迟无法保证。我们的解决方案分两层先引入轻量的告警置信度评估Agent或Workflow筛掉部分噪声再对保留问题进行排障推理。推理阶段仍有噪声我们引入类似循证医学的证据金字塔建立证据分级体系。挑战三如何衡量不确定性生产级AI系统中消除Bad Case困难存在大量Corner Case与Silent Error。我们有召回“单点抖动”问题但准确率劣化的案例。解决方法是引入Benchmark体系分为Case收集、评测集设计、评测集数据构造、评估四个阶段。挑战四对抗幻觉大模型在数值计算和趋势识别中存在幻觉问题。我们尝试多模态识别和时序数据识别都有问题最终采用孤立森林算法结合规则将判别能力封装为标准化算子积累成算子库。核心机制和架构设计从整体演进路线看经历了纯Rule - Based阶段、用Prompt编排SOP、Workflow与MCP组合到让Agent由大模型自主决定排查。Workflow确定可控但缺乏灵活性Agent灵活有泛化能力但有不确定性和延迟问题Agent并非完全取代Workflow。架构分层整体告警治理架构分层下层降噪声上面两层由AI处理。第一层用Workflow“快思考”处理固定系统类告警上层用Agent“慢思考”处理核心业务指标突变。快思考层面告警事件发出后经抑制规则判定、特征画像分析等部分告警可直接处置复杂问题走异步Agent分析流程。慢思考层面采用Multi - Agent架构告警事件触发后进入平台主Agent循环创建Plan动态调用Sub - Agent用到SubAgent领域封装、代码分析异步化、Agent通信Team等技术点。Agent自进化采用Few - shot模式设计自动构建案例集的系统解决人工构建案例的成本问题。Agent记忆排障需查询大量信息推理时初始化到Context和System Prompt中推理过程中动态检索搜索让Agent自己合并整理。产品交互与迭代OpenClaw有独特能力让AI更Proactive。产品迭代从Chatbot形式向AI Native自驱模式发展实现从问题感知到排障处置到协同处理的闭环。核心指标运营衡量MTTR缩短引入有效线索率、归因准确率、归因时长等过程指标。目前整体准确率超80%但推理层面准确率没这么高主要衡量有效线索准确率。实践中的坑遇到大模型层频繁失败、API接口不匹配等问题需处理故障、增强系统容错能力。总结和展望现有的监控系统围绕人构建Agent可处理大量复杂数据未来系统是否会重构值得思考。Agent领域发展快问题域业务资产等稳定层可持续积累Prompt描述等易变层随模型迭代变化。未来方向是向AI Native自主化、AI自进化演进从人主导排查到Agent出决策建议人审批最终走向Agent自我进化、自主闭环。