Keep 开源 AIOps 告警管理平台:从 0 到 5 分钟跑起来
Keep 开源 AIOps 告警管理平台从 0 到 5 分钟跑起来【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep凌晨 3 点Prometheus、Datadog、CloudWatch 几乎同时找你50 条告警涌进来其中一半在说同一件事。Keep 是一个开源 AIOps 告警管理平台把 100 多个监控工具的告警收进同一张表做去重、关联还能替你执行处理动作。本文先带你 5 分钟跑起来再讲功能和生产部署。它解决什么问题告警体系常见的麻烦基本集中在四件事上来源分散告警散落在云监控、APM、日志系统里值班人要在多个控制台之间来回切。Keep 把它们汇聚到同一个面板里。重复轰炸同一个数据库挂了上下游服务各报一次刷屏的是告警淹没的是真正的问题。Keep 提供去重、映射和关联把重复噪音压下去。缺上下文告警只告诉你出了事不告诉你跟什么有关。Keep 用 AI 把相关告警聚成事件并给出疑似根因。⚡响应靠手动重复故障每次都靠人肉处理。Keep 的工作流可以在告警触发的瞬间调用任意工具执行动作人不用到场。影响范围看不清拓扑页把环境里组件的依赖关系画出来出事的节点周围连着一串下游一眼能看出波及面。Docker 5 分钟部署 Keep环境要求装好 Docker 和 Docker Compose 的机器即可。git clone https://gitcode.com/GitHub_Trending/kee/keep cd keep docker-compose up -d大约一分钟容器全部起来。浏览器打开http://localhost:3000进入界面默认 compose 是无鉴权模式直接进。如果你改用带鉴权的docker-compose-with-auth.yml默认账号密码是 keep/keep登录后建议改掉。进去之后前 5 分钟可以按这个顺序玩连一个监控源在 Providers 页面添加数据源支持 webhook 直推也支持 Datadog、Prometheus、Grafana 等拉取式接入。看告警面板在 Feed告警表确认数据真的进来了顺手试试按严重度、状态过滤。试一个工作流Workflows 页面有 AI 助手用一句自然语言就能生成工作流配置。看服务拓扑到 Service Topology 页了解环境里组件的依赖关系。四个值得看的功能告警关联分析AI 帮你把告警聚成事件它做什么Keep 的 AI 插件会基于历史告警和事件记录训练关联算法判断哪些新告警应该归入已有事件哪些是全新问题阈值和训练轮次都可以在界面上调。对你意味着什么告警风暴时你不再需要一条条人肉归并——事件数量保持可控执行日志里还能看到每次合并的依据排查时先读事件再翻明细。界面长什么样配置页可以调训练精度阈值、关联阈值下方就是每次运行的执行日志和合并结果。服务拓扑一张图看清依赖关系它做什么Service Topology 页把环境里的平台、服务、数据库、消息队列画成一张依赖图节点上标着告警数。对你意味着什么API 服务报警时你能顺着连线看到它压在哪个数据库上、又喂给了哪些下游还有谁受影响这个问题不用再去问人。界面长什么样典型的拓扑长这样——Platform、API Service、DB、Kafka、Processor、Storage 之间的调用关系一目了然带红点的节点就是正在报警的。AI 工作流助手说人话就能建自动化它做什么在 Workflow Builder 里输入一句需求比如每分钟查一次 CloudWatch 日志发现 error 就发到我的 Slack助手会把它拆成触发器、查询、条件判断、通知动作几步逐步跟你确认。对你意味着什么不用记工作流 YAML 的每个字段非开发同学也能把重复故障的处置逻辑固化成自动化。界面长什么样左侧是对话和生成的步骤说明右侧同步渲染出触发器与步骤的可视化流程图。统一告警面板一张表处理所有告警它做什么所有来源的告警进同一张表列上有名称、状态、最近收到时间、负责人左侧是严重度、状态、来源、负责人等过滤维度顶部还能写 CEL 表达式做自定义搜索。对你意味着什么批量勾选标记解决、改派、进事件都在表格里直接完成值班交接看一张表就够了。界面长什么样深色主题下的告警表471 条告警按状态分组铺开每行都能单独展开处理。K8s 生产部署要点生产环境建议直接上 Helm Kuberneteshelm repo add keep https://keephq.github.io/helm-charts helm install keep keep/keep -n keep --create-namespace高可用主要盯三个配置项改对应的 values 即可副本数backend 设 3 个副本frontend 设 2 个避免单点资源配额给 backend 和 frontend 都设 requests/limits防止单实例把节点内存吃满持久化数据库开启持久化存储并配好容量告警历史才不会丢。另外Keep 自带 OpenTelemetry 指标支持把导出端点指到你的 collectorKeep 自身也能进你现有的监控大盘。接入你的监控生态Keep 内置 100 多个 provider大致分五类云平台监控AWS CloudWatch、GCP Monitoring、Azure Monitor、APMDatadog、New Relic、Dynatrace、日志与检索Elasticsearch、Grafana Loki、Splunk、通知渠道Slack、Teams、邮件、Webhook以及 AI 后端OpenAI、Anthropic、DeepSeek、Ollama 等给关联分析和工作流助手供能。完整清单可以在仓库的 docs/providers 目录里按名字找。工作流是 Keep 的自动化底座YAML 定义触发器可以是告警、定时或手动动作可以调用任意 provider 的方法。最简形态大概 5 行workflow: id: cloudwatch-slack-notifier triggers: - type: alert filters: - key: source value: cloudwatch actions: - name: trigger-slack provider: type: slack config: {{ providers.slack-prod }} with: message: Got alarm! {{ alert.name }}需要更多写法的话仓库 examples/workflows 目录里有上百个现成例子从定时任务到故障自愈都有直接改 ID 和参数就能用。落地路线建议PoC1-2 天Docker 跑起来接入一个真实数据源验证告警能从进来到被处理。开发环境约 1 周开持久化接齐团队在用的监控和通知渠道。预生产约 2 周上 Kubernetes配好备份和监控压一压告警量大的场景。生产约 1 个月多副本高可用、收紧访问控制把高频故障的处置沉淀进工作流。写在最后告警管理这件事难的不是多一块屏而是让涌进来的告警以你能处理的方式到达。Keep 把这个过程拆成了聚合、降噪、关联、自动化四步且每一步都是开源可改的。接下来三步克隆仓库用 Docker Compose 把 Keep 跑起来接一个你最常看的数据源让真实告警进面板用 AI 助手生成一个工作流处理掉一类重复故障。更多细节可以看仓库 docs/overview/introduction.mdx 入门文档工作流写法参考 docs/workflows 目录。【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考