适用场景

告警的价值在于"可信"。一天 500 条告警的团队,一定会忽略真正的故障。治理目标是把无效告警降到最低。

配置步骤(告警分级与通道)

# 分级建议
# P1 业务中断 / 数据风险:电话 + 群 + 工单,15 分钟响应
# P2 性能劣化 / 单点故障:群 + 工单,30 分钟响应
# P3 容量提醒 / 常规事件:工单,当日处理

关键参数与建议

  • 分级:P1 电话 + 群 + 工单;P2 群 + 工单;P3 仅工单
  • 收敛:同一故障重复告警合并(如按主机+指标聚合)
  • 依赖抑制:父主机/网络设备告警时抑制子告警
  • 静默与维护窗口:变更期间自动静默
  • 治理节奏:每月复盘 Top 告警,误报要么修要么删

容易踩的坑

  • 全部按 P1 推送,值班人员疲劳
  • 只发群无工单,处理过程无记录
  • 分级标准不清晰,判断靠感觉

验证与巡检

# 证据:告警分级表、各级响应达标率
  • 巡检:P1 响应达标率、月度统计

小结

告警治理的验收指标:告警总量下降、有效告警比例提升、P1 告警 100% 有人处理。三个月不治理,告警就会回到"没人看"的状态。

> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。