最近更新时间:2026-07-30 16:15:12
本文主要介绍如何在金山云云监控平台配置告警策略,当 KMR 集群的任务节点(Task Nodes)数量与 YARN 活跃节点管理器(NodeManagers)数量不匹配时,自动触发告警通知,帮助运维人员及时发现并处理节点异常。
在大数据集群运维中,KMR 集群的 Task 节点数量与 YARN NodeManager 进程存活数应当保持一致。如果出现不一致,可能意味着:
某些节点宕机或网络异常。
NodeManager 进程崩溃未重启。
集群缩扩容过程中出现的临时状态。
潜在的数据丢失或计算能力下降风险。
通过配置自动化告警,可以:
快速发现节点异常,减少业务影响时间。
过滤正常的缩扩容波动,避免误报。
提供标准化的监控指标和响应流程。
KMR 集群需正常运行,且已关联 Prometheus 实例。
KMR 集群与 Prometheus 实例需在同一可用区下。
已开通云监控 Prometheus 监控服务。
需拥有云监控控制台操作权限。
登录KMR控制台,查看并记录 KMR 集群完整 UUID。
提取集群 ID 前 8 位。
在正式创建告警前,建议先在指标探索页面验证表达式是否正确。
进入指标探索页面:云监控控制台 > Prometheus 监控 > 指标探索。
选择实例。
选择与目标 KMR 集群关联的 cloud-prometheus 实例。
确保实例与 KMR 集群位于同一可用区。
切换查询模式:点击编辑器右上角的 Code 按钮,切换到原生 PromQL 输入模式。
输入表达式。在查询框中输入:
resourcemanager_active_nms{uuid="集群ID"} / sum(nodemanager_process_alive{clusterId="集群ID"})设置查询参数。
Legend(图例):默认为 Auto,可根据需要自定义展示标签。
Min step(最小步长):根据时间范围和间隔需求设置,以获得平滑的时间序列曲线。
Format(格式):选择 Time series,以观察随时间变化的波动。
Type(类型):选择 Range,以查看历史时间段内的整体一致性。
执行查询。
点击 Run query,观察 Graph 曲线是否符合逻辑。
若集群状态正常,曲线应恒等于 1。若出现不等于 1 的波动,则说明两端节点数据不一致。
登录金山云云监控控制台。
进入 Prometheus 监控 > 告警管理 > 新建告警策略。
在 新建告警策略 页面,填写以下参数:
创建类型:固定选项,建议填写页面编辑。
策略名称:自定义即可,建议命名 KMR_Node_Consistency_Check。
名称应具备辨识度,会直接展示在告警通知中。
关联资源:下拉选择,选择与目标 KMR 集群关联的 Prometheus 集群。
配置告警规则,具体如下。
规则启停:开启该按钮。
规则名称:填写具体的规则识别名,如 nodemanager_number_consistency_test。
规则表达式:填写以下 PromQL 表达式。
resourcemanager_active_nms{uuid="集群ID"} / sum(nodemanager_process_alive{clusterId="集群ID"})持续时间:推荐值 10 分钟或 15 分钟,用于过滤由于集群正常缩扩容导致的短时间数据不一致。
标签:告警等级,根据业务重要程度选择。
critical:需要立即处理的告警。
error:产生错误,可能需要处理。
warning:存在风险。
告警摘要:填写简要描述,如 KMR 节点数与 NodeManager 不一致。
告警内容:填写详细说明,如 检测到当前集群活跃节点数与进程存活数比例异常,请检查是否存在节点挂起。
配置告警通知,需设置以下参数。
通知对象:选择对应的联系组或联系人,勾选通知方式(短信、邮箱)。
告警回调(可选):如有自动化运维平台,可填写回调 URL 以实现自动处理逻辑。
点击确认,完成告警策略的配置。
纯净模式
