高可用与冗余:业务不中断的底线
导语:冗余保数据、高可用保业务——两者都到位,才敢说"不停机"。
一、为什么要关注(背景与痛点)
单位常把"做了 RAID"等同于"高可用",结果控制器坏了、网络断了,业务照样停。RAID 只防盘坏,高可用要防的是"任何单点故障都不影响服务"。对连续作业的单位,停机一分钟可能就是一笔损失。
二、核心原理 / 关键概念
- 冗余(Redundancy):部件级双份,如双电源、RAID、热备盘。
- 高可用(HA):系统级切换,单点故障自动接管、业务不中断。
- 单点清单:电源、控制器、网络、服务进程都可能是单点。
- RTO 视角:高可用的目标是把恢复时间压到秒级甚至零。
- 双活 vs 主备:双活无感切换,主备有切换窗口。
三、落地做法 / 操作步骤
- 找单点:逐层排查电源/网络/控制器/服务是否单点。
- 补冗余:双电源、双网口聚合、热备盘先配齐。
- 上 HA:关键业务部署主备/双活,自动接管。
- 演练:定期制造单点故障,验证业务真不中断。
检查清单:
- 单点清单已排查
- 电源/网络/盘冗余已配
- HA 切换已演练
四、与群晖NAS / 信创云盘的对应能力
群晖 NAS 支持双网口聚合、热备盘与存储池冗余,降低单点风险;配合双机或集群方案可进一步实现服务接管。信创云盘(软件化部署)可跨节点部署,单节点故障由其他节点承接,把"高可用"从硬件延伸到服务层。
五、常见误区 / 避坑提醒
- 误区:RAID=高可用。盘冗余不防控制器/网络/服务故障。
- 误区:主备永不切。不演练,切换时往往失败。
- 误区:只保硬件。服务进程单点同样会停业务。
六、小结与行动建议
先消除单点,再上 HA,最后演练。冗余是地基,高可用是目标,二者凑齐才是不停机。