跳至正文

如何提前发现磁盘坏了

等 Pod 报错再去抢修属于被动运维。为了在 mkdir 失败前就提前逮住坏盘,运维在全局 Prometheus 上必须死守以下两项单盘硬件指标:

  1. 磁盘只读状态监控 (Node Exporter 核心指标):
    物理磁盘损坏时,Linux 内核为了保护数据,会自动把 XFS 文件系统降级为只读(Read-Only)。
    ◦ 告警规则:node_filesystem_readonly{mountpoint=~”/data1|/data2″} == 1
    ◦ 效果:一旦某台虚拟机的 /data2 变只读了,还没等 Pod 重启,运维的手机就会收到告警,可以提前进行节点维护。
  2. 磁盘 I/O 延迟监控:
    如果虚机的 vdc 盘对应宿主机的物理 SSD 出现了严重物理坏道,I/O 读写延迟会从正常的几毫秒飙升到几百毫秒。
    ◦ 告警规则:rate(node_disk_write_time_seconds_total{device=”vdc”}[5m]) / rate(node_disk_writes_completed_total{device=”vdc”}[5m]) > 0.05(写延迟大于 50 毫秒)。

🔒 原创版权声明

本文标题:如何提前发现磁盘坏了

原文链接:https://www.infraserviceonline.com/%e5%a6%82%e4%bd%95%e6%8f%90%e5%89%8d%e5%8f%91%e7%8e%b0%e7%a3%81%e7%9b%98%e5%9d%8f%e4%ba%86/

版权来源:Infraservicenow

⚠️ 重要声明:本站所有文章均为原创技术文档,未经作者书面正式授权,严禁任何形式转载、复制、摘抄、二次发布

如需转载、引用、整理发布,请务必提前联系作者获得授权,违者将依法追究侵权责任。

© 2026 Infraservicenow All Rights Reserved. 保留所有权利。


发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

error: Content is protected !!