适用场景

告警的价值在于"可信"。一天 500 条告警的团队,一定会忽略真正的故障。治理目标是把无效告警降到最低。

配置步骤(告警收敛与依赖抑制)

# Zabbix 依赖示例:主机依赖交换机,交换机告警时抑制主机告警
# Prometheus Alertmanager 抑制规则
inhibit_rules:
- source_match: { severity: critical, alertname: SwitchDown }
  target_match: { severity: warning }
  equal: [instance_domain]

关键参数与建议

  • 分级:P1 电话 + 群 + 工单;P2 群 + 工单;P3 仅工单
  • 收敛:同一故障重复告警合并(如按主机+指标聚合)
  • 依赖抑制:父主机/网络设备告警时抑制子告警
  • 静默与维护窗口:变更期间自动静默
  • 治理节奏:每月复盘 Top 告警,误报要么修要么删

容易踩的坑

  • 网络抖动引发上百台主机告警,无人能看
  • 未配抑制,告警互相淹没
  • 收敛过度,真实告警被合并丢弃

验证与巡检

# 观察:一次网络故障后的告警总数
  • 巡检:告警风暴次数、收敛规则有效性

小结

告警治理的验收指标:告警总量下降、有效告警比例提升、P1 告警 100% 有人处理。三个月不治理,告警就会回到"没人看"的状态。

> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。