适用场景

演练的目的不是「证明系统很强」,而是找出预案里没写的坑。所以要先做桌面推演找出流程问题,再做真实注入验证技术手段,最后一定要记录并闭环改进项。

配置步骤(实验设计与爆炸半径)

# 实验卡模板
实验名:核心交换机上联断链
假设:A 面链路断开后,流量 3 秒内切到 B 面,业务错误率上升不超过 1%,持续不超过 10 秒
注入:在 A 面交换机对应端口 shutdown(或拔纤)
观察:出口丢包、业务错误率、告警触发时间、切换耗时
终止条件:业务错误率 > 5% 持续 1 分钟,或恢复时间超过 5 分钟 -> 立即回滚注入
爆炸半径:仅影响办公网访问,不影响对外业务端口

# 爆炸半径控制手段
- 只在一个可用区/一台实例上注入
- 限制受影响的服务列表(白名单)
- 注入时长上限(如 5 分钟自动停止)

关键参数与建议

  • 分级:桌面推演 → 单组件注入 → 全链路演练,逐级提升风险
  • 实验设计:明确假设(预期行为)、注入内容、观察指标、终止条件
  • 影响面控制:先在测试/预发环境,生产演练要选低峰并设爆炸半径
  • 终止条件:错误率或时延超阈值立即停止注入(kill switch)
  • 参与角色:指挥、执行、观察、业务验证,四方齐全
  • 观察项:告警是否触发、预案是否可执行、切换是否在规定时间内完成
  • 复盘:时间线 + 问题清单 + 改进项(负责人与时间)
  • 常态化:每季度至少一次单组件注入,每年一次全链路

容易踩的坑

  • 直接在核心设备上做实验,没有终止条件
  • 爆炸半径没界定,一次演练全网受影响
  • 假设写得含糊(「应该会自动切换」),无法验证
  • 没通知业务方,用户投诉才算发现
  • 注入工具没有自动停止机制,人忘了恢复
  • 实验不做记录,下次重复踩同一个坑

验证与巡检

# 实验检查
1) 实验卡有假设、注入项、观察项、终止条件?
2) 爆炸半径与控制措施明确?
3) 回滚操作能在 1 分钟内执行?
4) 相关方已通知?
  • 巡检:实验卡齐备、kill switch 验证过、通知记录、复盘报告归档

小结

故障演练验收:告警在规定时间内触发、预案步骤可执行、RTO 达标,且产出的改进项在下一次演练前全部闭环。

> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。