Keep 开源告警管理平台:驯服告警风暴的实用指南 Keep 开源告警管理平台驯服告警风暴的实用指南【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keepKeep 是一款开源 AIOps 告警管理平台把散落在 Prometheus、Grafana、Datadog 等各监控工具里的告警汇聚到同一块屏幕并提供去重、AI 关联和自动化工作流适合被告警风暴刷屏、又不想再买一套商业 APM 的运维团队。先看一个场景 凌晨两点一个数据库慢查询同时触发了 Prometheus 的 CPU 告警、Grafana 的响应延迟告警、Datadog 的错误率告警你的手机在 10 分钟内震动 30 次。你真正要处理的是 1 个问题看到的却是 30 条通知。这就是 Keep 想解决的事它不做监控采集而是站在你所有监控工具的上层把告警收进来然后做四件事——聚合展示、去重、关联成事件、自动处理。告警多了之后最先缺的不是看而是分清哪些是一回事。四个值得看的能力所有告警聚到一张表 能做什么各监控工具的告警统一进同一个 Alert 列表按严重程度、状态Firing/Resolved/Suppressed、来源、指派人筛选。怎么做在 Providers 页面接上你的监控工具支持 pushwebhook 实时推和 pull定时拉取两种方式推荐 push。得到什么一个事实来源新告警通过 websocket 实时推送到页面不用再切控制台。左侧面板可按 Severity、Status、Source 组合过滤右侧是实时告警流。告警去重先把噪音砍掉 能做什么把同一问题、不同来源的告警合并成一条。分两种模式——部分去重按你指定的字段如 service error_message归组完全去重直接丢弃完全重复的告警。怎么做每个 provider 都预置了默认的指纹字段规则你可以按自己告警的结构改也可以忽略某些字段比如时间戳。得到什么一条告警背后挂了 N 个来源通知量肉眼可见地降下来。规则详见 去重文档。AI 告警关联自动聚成事件 能做什么把时间上、语义上相关的多条告警归成同一个 incident比如网络延迟高 应用响应慢自动归为一起。怎么做分两层——手动关联规则基于告警属性写条件人人可用AI 关联则用 transformer 模型基于你自己的告警历史训练界面里可以调准确率阈值、关联阈值和训练轮数模型置信度不够时会转人工。得到什么从30 条告警变成3 个事件排障入口少了一个数量级。注意它需要配置 AI 后端如 OpenAI不是开箱即用。执行日志里能看到每条未关联告警的匹配分数和归属事件。工作流告警来了之后自动干活 ⚙️能做什么告警触发后自动执行动作——开 Jira 工单、发 Slack/邮件、调任意 HTTP 接口、跑 Python 脚本甚至删掉故障的 K8s Pod。怎么做工作流是 YAML 文件可以手动上传也可以在 Web 界面里用自然语言描述需求每分钟查 CloudWatch 日志发现 error 就发 SlackAI 会生成带触发器、条件、动作的完整工作流你确认后保存即可。得到什么一套监控工具的 GitHub Actions。仓库里 examples/workflows/ 有 100 现成模板可直接抄。上手快跑 有 Docker 的话一条命令就能跑起来默认 compose 不带登录校验数据落在本地 SQLitegit clone https://gitcode.com/GitHub_Trending/kee/keep cd keep mkdir -p state docker compose up -d打开http://localhost:3000即可使用。三个容器分别是前端3000、后端 API8080、websocket6001全部配置见 docker-compose.yml。接上第一个监控工具只需三步Providers 页面选工具 → 填凭据 → 勾选 Install Webhook让 Keep 自动帮你建 webhook。之后去 Alerts 页面等告警进来。边界说明它适合谁不适合谁 适合同时用 3 个以上监控/告警工具想统一入口的团队告警量大、噪音多需要去重、关联、自动处理有 Docker 环境、愿意自己维护一个中间件层不适合想要接上就能出监控指标的——它不采集指标监控工具仍然得自己部署告警总量很小、一个工具就够的小团队引入成本大于收益期望 AI 功能零配置开箱即用的——需要你自己配 AI 后端密钥无法部署容器化服务的纯本地脚本环境常见坑 ⚠️页面打得开但告警不实时刷新→ 检查 websocket 容器6001 端口是否存活docker compose ps。前端靠它推送缺了就只有手动刷新能看到新告警。生产环境还在用默认配置→ 默认 compose 是 NO_AUTH 本地 SQLite数据都在state/目录。上生产建议换 docker-compose-with-auth.ymlDB 认证默认账号密码均为 keep登录后立刻改密码并把DATABASE_CONNECTION_STRING指向外部 PostgreSQL。AI 关联/助手点了没反应→ 后端从环境变量OPENAI_API_KEY读密钥支持用OPENAI_BASE_URL指向 LiteLLM 等代理。启动 compose 前没注入这个变量AI 功能就是空的。pull 模式拉不到实时告警→ pull 主要用来回补历史告警不触发工作流。要实时就开 push 模式provider 设置里的 Install Webhook这也是官方推荐方式。升级/重装后数据没了→ 数据全在state/目录含 SQLite 库和 secrets 文件。备份或迁移前先停容器再整体拷贝这个目录。写在最后Keep 的定位很克制不替换你的监控工具只做告警进来之后的聚合、降噪和自动化这一层——这恰恰是大多数团队最缺的一块。用上面 4 行命令先跑起来随便接一个 Prometheus 试试抄一个 examples/workflows/ 里的模板体验告警自动处理告警量上来之后再考虑去重规则和 AI 关联先降噪再上智能【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考