适用场景

告警的价值在于"可信"。一天 500 条告警的团队,一定会忽略真正的故障。治理目标是把无效告警降到最低。

配置步骤(月度治理流程)

# 1) 统计 Top 告警(按规则/主机)
# 2) 分类:真实告警、误报、重复
# 3) 处置:误报调整阈值或删除、重复加收敛
# 4) 输出:治理报告与下月目标

关键参数与建议

  • 分级:P1 电话 + 群 + 工单;P2 群 + 工单;P3 仅工单
  • 收敛:同一故障重复告警合并(如按主机+指标聚合)
  • 依赖抑制:父主机/网络设备告警时抑制子告警
  • 静默与维护窗口:变更期间自动静默
  • 治理节奏:每月复盘 Top 告警,误报要么修要么删

容易踩的坑

  • 不统计,只知道「告警很多」
  • 误报不处理,靠值班人员「习惯性忽略」
  • 治理无目标,效果不可衡量

验证与巡检

# 证据:月度告警治理报告(总量/有效比例/Top 规则)
  • 巡检:告警总量趋势下降

小结

告警治理的验收指标:告警总量下降、有效告警比例提升、P1 告警 100% 有人处理。三个月不治理,告警就会回到"没人看"的状态。

> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。