群晖NAS存储池显示已降级Degraded怎么办

问题

公司 NAS(如群晖 DS925+/DS1525+ 这类机型) DSM 后台弹出告警:“存储池已降级”,存储管理器里看到其中一块硬盘状态异常。大家第一反应是数据还在不在、要不要马上拔盘。此时最怕两种极端:要么吓得直接拔盘断电,要么拖着不管继续跑。

常见原因

存储池降级 = 冗余被打破但数据仍可访问:

  1. 一块成员盘故障/被识别为异常(RAID 1/5/6 少了一块仍能运行)。
  2. 硬盘被误拔出或接触不良,系统判定盘丢失。
  3. 盘本身 SMART 异常(坏道累积)被系统主动隔离。
  4. 扩容或换盘过程中操作中断。

分步解决

第一步,稳住不动:降级不等于数据丢失,此时最忌"再拔一块盘试试"。先确认业务数据能正常读写,顺手把最关键的数据再备份一份到 NAS 之外——降级状态下阵列没有容错余量。

第二步,定位故障盘:存储管理器→存储→点开降级的存储池查看成员盘状态;到 HDD/SSD 页面看哪块盘报"严重"或"失效",结合 SMART 信息(重映射扇区、待映射扇区)确认。

第三步,分场景处置:

  • 硬盘是"被意外拔出/接触不良":断电重新插回原盘位(不要初始化!),存储池短暂显示降级后,选中该池→右上角菜单→“修复”,选刚插回的盘即可回归。
  • 硬盘确实故障:换上同容量或更大容量的新盘(RAID 5/6/1 要求新盘可用容量不小于池中最小盘,否则修复必失败),进入"修复"流程选新盘,系统开始重建(视容量与负载,可能持续数小时到一天以上)。

第四步,重建期间纪律:不跑高负载任务(大文件搬迁、视频转码)、不中断重建、盯着重建百分比与各盘 SMART。重建让剩余老盘满负载运转,是二次故障高发期。

第五步,重建完成后复查:存储池状态回"良好",故障盘若在保修内走换新;顺带检查 DSM 与存储池的邮件/推送告警是否真的发出来了。

第六步,若修复失败或池已"损毁":停止一切写入,不要反复点修复,数据重要的先做整盘镜像再求助专业恢复(详见"RAID 重建失败"一题)。

预防

  • 启用 DSM 的邮件/即时通知,硬盘异常第一时间知道,而不是业务瘫了才知道。
  • 成员盘使用同批次同型号,按 3~5 年周期整体轮换;避免 SMR 叠瓦盘混入阵列。
  • 降级即处理,不裸奔运行;冗余之上另做备份(RAID 不等于备份)。
  • 换盘前先确认有可用的冷备盘,缩短降级窗口。

参考资料

更多企业 IT 实战经验,请浏览本站技术博客,或联系我们获取方案支持。