适用场景

超融合把计算、存储、网络揉在一起,好处是简单,风险是「一起坏」。运维要点:扩容要慢、重建要盯、故障域要分开、容量要留余量。

配置步骤(故障域与节点故障处理)

# 1) 故障域检查清单
#  - 三节点是否在同一机柜?(应分在不同机柜)
#  - 供电是否来自同一 PDU?(应双路分供)
#  - 存储内网是否同一交换机?(应双上行两台交换机)

# 2) 节点故障处理流程
#  a. 确认节点状态(失联/宕机)
#  b. 确认副本与数据是否健康(是否有降级)
#  c. 判断是网络问题还是主机问题(先看交换机与链路)
#  d. 恢复节点后观察重建,不要立刻叠加业务

# 3) 演练:模拟断电
#  - 断电一台节点,验证:
#      业务不中断、副本自动重建、告警正确

关键参数与建议

  • 容量余量:单节点故障后剩余容量要能承载重建,实际可用水位不超 70%
  • 故障域:机柜、供电、交换机都要分开,别把三节点塞进一个机柜
  • 扩容:一次加一台,等数据均衡完成再加下一台,避免同时重建压力叠加
  • 重建监控:重建期间盯时延与业务影响,必要时限速
  • 版本一致:集群内节点版本必须一致,升级走滚动流程
  • 网络:存储内网独立,万兆起步,链路冗余
  • 备份:集群内副本不等于备份,重要数据必须异地或离线备份
  • 演练:模拟单节点宕机,验证业务不中断且自动恢复

容易踩的坑

  • 三节点同机柜,机柜断电集群整体不可用
  • 存储内网同一台交换机,交换机重启即集群脑裂
  • 节点失联先重启主机,实际是网络问题导致重复重建
  • 副本策略配成 1 副本,节点故障数据直接丢
  • 恢复节点后立刻跑大批量任务,重建与业务互相拖累
  • 报警没分级,节点故障与磁盘告警混在一起

验证与巡检

# 节点与副本健康(按厂商命令)
# 1) 节点 online、无 offline
# 2) 无降级卷、无 failed 磁盘
# 3) 副本策略符合设计(关键业务 ≥2 副本)

# 演练记录:断电节点、恢复时间、业务验证、重建耗时
  • 巡检:故障域分离、副本策略正确、季度断电演练、恢复时间达标

小结

超融合验收:拔掉一台节点的电源,业务不中断、数据不丢、重建在计划时间内完成;扩容一台节点后数据自动均衡。

> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。