给 NAS 装「心电图」:资源监控记录保留与超阈值告警

为什么出事时总是没有数据

存储满了、CPU 飙了,老板问"什么时候开始的",答不上来——因为资源监控器默认只看实时,历史曲线没开。给它装上"心电图"分两步:先开记录,再设告警。

第一步:把历史记录开起来

进资源监控器 > 设置,勾选"启用使用情况历史记录"并应用,之后性能页每个图表右上角就能在实时、1 周、1 个月、6 个月、1 年之间切换。采样密度随时间范围变化:1 周每分钟记一个点,1 个月每 5 分钟一个,6 个月每 30 分钟一个,1 年每 120 分钟一个。越久远的曲线越粗,但足够看清趋势。

建议新机器上线当天就打开——这类数据是攒出来的,出事前没有记录,事后就没有对比基准,排障和容量规划都缺依据。

第二步:设警报规则

性能警报里点创建,四项设置:资源(CPU、内存、硬盘、卷等按需选择)、类型与临界值百分比、警报层级。比如给卷使用率设一条规则,超过临界值就提醒该规划扩容了;再给 CPU 设一条,长期高位提示有进程异常。

规则不是一超就报,它的防误报机制值得了解:性能警报服务每 5 分钟检查一轮规则;发现超阈值后并不立即通知,而是以 30 秒为间隔再核对五次,连续五次都超才触发警报;期间有任何一次回落到临界值以下,检查间隔就退回 5 分钟。瞬时毛刺被这套机制挡在门外,两次警报之间的间隔上限是 450 秒,不会形成告警风暴。

层级与通知:让警报找到人

警报分两级:警告级别只在系统日志里留记录,不打扰人;重要级别除写日志外还会触发系统通知。要让通知真正到达人手上,前提是先在控制面板 > 通知里配好邮件等渠道——这一步漏了,规则等于白设。

触发的警报在日志页集中可查,支持导出 HTML 或 CSV 存档,日志中心的记录里也能看到。两点注意:Value 系列和 J 系列机型不支持性能警报;同一指标建议设"警告+重要"两档阈值,先温和提醒,再强制上报。

把"事后救火"换成"超标即知",一个人管几十台设备也从容。需要告警策略与运维方案设计,欢迎联系贵州诚鑫致达科技。