硬盘健康自查:群晖 S.M.A.R.T. 检测、坏道扫描与预警

适用场景

机架上一排 NAS,几十块硬盘各跑了三五年,哪块在带病坚持?等「已降级」红色警报弹出才动手,就已经进入换盘修复流程的被动局面了。盘坏前其实几乎都会先递条子:重映射扇区增长、坏道冒头、温度常年偏高——这些信号都写在 S.M.A.R.T. 数据里。把检测做成例行制度,换盘就从救火变成排班。

先会看:HDD/SSD 页的状态与信息

进入「存储管理器」>「HDD/SSD」,每块盘一目了然:

  • 点展开图标:槽位、硬盘状态、分配角色、温度、固件版本;
  • 点「状况信息」:开机时长、温度曲线等统计,进「S.M.A.R.T.」标签页看原始指标;
  • 状态含义要记牢:「正常」可安心;「严重」= 出现关键错误、只读模式或 SSD 耐久性见底,建议立即更换;「不兼容/未验证/无法识别」直接换兼容盘;「无法访问系统分区」可点「修复系统分区」尝试救。

手动跑一次检测

  1. 「存储管理器」>「HDD/SSD」,选中一块盘,点「状况信息」;
  2. 切到「S.M.A.R.T.」标签页(不支持的型号不显示);
  3. 选「快速检测」(几分钟,查电气与机械基本项)或「完整检测」(全盘扫描坏道,几 TB 盘要跑数小时,安排闲时);
  4. 点「开始运行测试」,结果在「历史纪录」里可对比历次趋势。

测试期间系统性能会受暂时影响,别在白天备份窗口跑完整检测。

让它自动跑:计划与预警一起开

  • 检测计划:「HDD/SSD」>「设置」>「检测计划程序」>「创建」——任务类型选 S.M.A.R.T.,快速检测设每月(如每月第一个周日凌晨),全池范围;关键数据的服务器可再加一个每季度的完整检测;
  • 坏扇区警告:「设置」>「高级设置」> 勾选「启用坏扇区警告」——坏道零星出现是正常老化,数量快速攀升才是盘要报废的信号,开了警告系统会第一时间提示;
  • SSD 耐用性提醒:同样在「高级设置」里开启,给全闪配置设好剩余寿命阈值,SSD 不像机械盘有坏道可看,寿命估算就是它的体检报告。

换盘决策与健康留档

什么时候该换:状态亮「严重」立即换;快速检测报错换;坏扇区重映射计数连续两次检测持续增长,列入换盘计划(提前买好兼容备盘,低峰期替换,不必等它真坏)。注意 NVMe SSD 有自己的监控机制,不走 S.M.A.R.T. 测试和坏扇区警告,看耐用性指标即可。

每台 NAS 建一份硬盘台账:槽位、型号、序列号、购入日期、历次检测结论,半年更新一次。交接和报修时,这份留档比现场挨个跑检测快得多。盘的选型思路可再参考存储介质生命周期与 SMART 预警

小结

硬盘健康管理三件套:每月自动 S.M.A.R.T. 快速检测、坏扇区警告常开、台账定期更新。指标恶化就按预案换盘,把风险消灭在降级警报之前——几分钟的配置,省掉的是一次凌晨的机房救火。


如需为贵单位建立硬盘巡检制度与备件预案,或了解群晖企业级 NAS 产品,欢迎联系贵州诚鑫致达科技。