适用场景
跨城灾备的难点不在技术复制,而在"决策":谁有权切、什么条件切、切完数据差多少、怎么回切。
配置步骤(切换决策与通知)
# 触发条件示例
# 1) 主机房断电/网络中断 > 30 分钟
# 2) 数据库不可用且无本地恢复可能
# 决策链:值班 -> 运维负责人 -> 业务负责人确认
# 通知:内部群 + 业务方 + 必要时对外公告
关键参数与建议
- 决策机制:明确触发条件、决策人与通知流程(避免多头指挥)
- 数据:复制延迟监控,切换前确认 RPO 实际值
- 执行:切换脚本化/剧本化,减少人工误操作
- 域名与流量:DNS/GTM 或应用层网关切换,注意 TTL 与缓存
- 回切:回切条件与步骤同样要演练
容易踩的坑
- 决策人不在,切换延迟两小时
- 多头指挥,执行冲突
- 不通知业务方,切换后业务侧不知情
验证与巡检
# 证据:切换决策记录(时间、决策人、依据)
- 巡检:决策表年度更新、联系方式有效
小结
跨城灾备验收:每年至少一次全量切换演练,记录切换耗时、数据丢失量与问题清单,并把改进项闭环。
> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。