RAID5阵列坏了一块盘还能撑多久再坏一块会怎样
问题
公司服务器的 RAID 5 阵列告警:一块硬盘故障,阵列处于降级状态。运维说"还剩两块好盘,业务先正常跑,新盘下周到货"。这个"降级裸奔"状态风险有多大?如果重建前又坏一块,数据是不是就没了?
原理说清楚
RAID 5(三盘为例)用分布式校验容错:任意坏一块盘,系统靠剩余盘+校验数据算出缺失内容继续工作——这就是"降级运行"。但此时:
- 容错额度已经用光:再坏任何一块盘 = 数据整体不可访问,只能靠专业恢复碰运气。
- 重建窗口是危险期:换新盘重建要对剩余每块盘全盘读取,老盘满负载高强度运转,“同批次老盘在重建期接续阵亡"是存储行业最经典的翻车剧本——盘是同一年买的,寿命也差不多。
- 大容量盘重建动辄十几个小时到一两天,窗口越长风险越大。
- 降级期间性能下降,若再遇坏道读不出来,重建直接失败。
分步解决
第一步,降级即启动应急:确认告警属实后,当天就把关键数据再备份一份到阵列之外——降级状态下任何二次故障都可能让数据全灭,“先备份再重建"是铁律。
第二步,尽快换盘重建:新盘容量不小于阵列中最小盘、优先同型号 CMR 盘;RAID 控制器/NAS 后台发起重建,全程监控百分比与各盘 SMART。
第三步,重建窗口降低负载:暂停大文件迁移、备份任务、虚拟机迁移等重 IO;有条件先迁移业务再重建。
第四步,重建失败或期间又坏一块:立即停止写入、不要反复尝试重建,保住成员盘现状;数据重要的走"先整盘镜像+专业 RAID 恢复"路径,成功率取决于盘体状态与后续写入量,无人能承诺 100%。
第五步,重建完成后复盘:对故障盘走保修;检查其余盘 SMART(05/C5 有苗头的列入观察);评估是否该整体换新——同批次盘接连故障是整批老化的信号。
预防
- 重要业务至少 RAID 6(双冗余)或 RAID 10,别把公司命脉押在 RAID 5 的"一次容错"上。
- 机械盘 3~5 年按批次主动轮换,别等坏。
- 降级告警必须即时通知到人(邮件/短信),冷备盘常备,把降级窗口压到最短。
- 再强调一次:RAID 管可用性,备份管可恢复性,阵列再豪华也要有阵列外的备份。