别等硬盘坏了才后悔:数据清理(Scrubbing)计划配置

适用场景

很多网管有个心理误区:上了 RAID 5/6,数据就进了保险箱。真正的隐患叫静默损坏——盘上的数据块因为磁介质老化、宇宙射线位翻转等原因悄悄变坏,平时没人读它就不报警,等到一块盘真坏、RAID 拿校验位重建时,才发现校验数据本身早已经烂掉,坏块配合坏盘一起让文件损坏。数据清理(Data Scrubbing)就是对付它的:定期全池比对数据与校验位,发现不一致就自动用完好的那份修复。这是容灾体系里最便宜的一道保险,只需要一个计划。

前提条件

  • 存储池为 SHR(三块盘及以上)、RAID 5、RAID 6 或 RAID F1;或池上的存储空间是 Btrfs;
  • 共享文件夹若开了「数据总和检查码以实现高级数据完整性」,清理时还能核对修复文件内容;没开的只能查校验位层面(控制面板 > 共享文件夹 > 编辑 > 高级设置里可开,限 Btrfs)。

配置入口:「存储管理器」>「存储」>「计划数据清理」。

配置计划:一次性五分钟

  1. 进入「存储管理器」>「存储」,点「计划数据清理」按钮;
  2. 勾选「启用数据清理计划」;
  3. 勾选要纳入计划的存储池(不支持的池不会出现),多池时设置优先级——注意同一时间只在一个池上跑
  4. 设置频率与时段:频率选「每月重复」;时间网格安排在凌晨闲时,比如每月第一个周六 02:00-06:00;
  5. 保存。下次运行时间会直接显示出来。

临时想提前跑一次(比如换盘前):选中存储池,在「数据清理」区域点「立即运行」。运行期间池状态会显示「正在运行数据清理」,跑完自动回「良好」。

与 RAID Resync 的区别

两者常被混为一谈:Resync 是被动触发的重建/校验流程,发生在换盘修复、扩容、改 RAID 类型这类池操作时;数据清理是主动巡检,闲时定期全池体检,专抓静默坏块。Resync 的速度走全局限速设置,清理也有自己的时间网格——一个保事故后恢复,一个防慢性病恶化,缺一不可。

注意事项

  • 清理会持续读全池,白天业务高峰跑会有可感知的性能影响,务必排凌晨或周末;
  • 大容量池跑数小时到一天都正常,期间无需干预;
  • 异常断电会中断计划清理,开机后自动续跑;
  • 已降级的池会被暂时移出计划,修复完成后自动加回——先修复再清理,顺序别反;
  • 想改计划注意:修改会取消正在进行的那次清理,按新计划重来。

小结

数据清理是「零成本高回报」的典型配置:五分钟设好每月凌晨的自动巡检,换来的是重建时校验位真的可用。新机上线清单里应该有它的名字——建完存储空间就顺手把计划配上,别等坏盘那天才后悔。


如需为贵单位建立数据巡检与容灾保护体系,或了解群晖企业级 NAS 产品,欢迎联系贵州诚鑫致达科技。