适用场景

RAID 配错往往在半年后才暴露:坏一块盘没有热备自动顶上去、阵列降级没人发现,直到第二块盘也坏了才发现数据已经取不回来。开局配好并纳入巡检是关键。

配置步骤(磁盘替换与重建流程(通用))

# 1) 确认坏盘位置(点灯定位,不允许凭印象拔盘)
storcli64 /c0 /e252 /s2 locate start
# 2) 确认阵列当前状态与是否有热备在重建
storcli64 /c0 /vall show
storcli64 /c0 /eall /sall show | grep -i rebuild
# 3) 拔旧盘、插新盘(同容量或更大;不要插同槽位以外)
# 4) 确认自动重建,或手动指派为热备
storcli64 /c0 /e252 /s2 add hotsparedrive
# 5) 重建期间避免高负载与二次维护

关键参数与建议

  • 系统盘做 RAID1(或 RAID10),数据盘按业务定 RAID5/6/10,别为了容量把数据库放 RAID5
  • 每类阵列至少配 1 块全局热备(RAID5/6 建议 1~2 块),热备盘容量不能小于阵列成员盘
  • 建阵列时确认条带(stripe)与读写策略,数据库类业务优先写回策略 + 电池/超级电容在位
  • 把 RAID 卡管理工具(storcli/perccli/arcconf)纳入运维包,别等坏了才找工具
  • 坏盘更换必须等阵列重建完成再动第二块盘,且按槽位顺序记录

容易踩的坑

  • 重建未完成就拔第二块盘,等于自杀;RAID5 上连坏两块基本无解
  • 新盘容量小于原盘会直接拒绝加入
  • 重建期间做全量备份/大批量导入,会把重建时间拉长数倍,风险叠加

验证与巡检

storcli64 /c0 /eall /sall show | grep -i rebuild
  • 巡检:重建进度 100%、状态 Optimal、归档本次故障的处理记录与盘序列号

小结

RAID 是"容错"不是"备份"。做完阵列仍要按业务做备份与恢复演练,坏了盘能重建、删了库能恢复,才叫双保险。

> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。