linux smartctl是什么,怎么用?

用smartctl一条命令就能提前看穿硬盘的“亚健康”状态,避免服务器突然宕机、数据丢失的惨剧。

在Linux服务器运维中,硬盘故障是导致数据灾难的“头号杀手”之一,大量案例表明,硬盘在彻底罢工前,通常会通过S.M.A.R.T.数据发出预警信号,smartctl作为smartmontools套件中的核心命令行工具,可以读取这些信号,让运维人员提前介入。

Linux命令精讲之smartctl/hdparm(磁盘健康)
加载中
Linux命令精讲之smartctl/hdparm(磁盘健康)

smartctl是什么?为什么服务器运维离不开它?

几乎每一块现代机械硬盘和固态硬盘都内置了S.M.A.R.T.(自我监测、分析及报告技术)系统,它像硬盘的“体检医生”,记录着通电时间、启停次数、坏道数量、温度等关键指标,smartctl正是用来与这个“医生”对话的工具通过发送ATA/SCSI/NVMe指令,获取硬盘内部的健康数据。

行业共识认为,硬盘年故障率会随着使用年限增长显著上升,尤其在运行超过3万小时之后,但很多故障并非突然发生,重映射扇区数、待处理扇区数等指标往往在故障前几周就开始异常,定期用smartctl巡检,相当于给服务器硬盘做“预防性体检”,能大幅降低突发停机风险。

如何快速安装smartctl?(CentOS与Ubuntu演示)

smartctl由smartmontools包提供,几乎所有Linux发行版官方仓库都已收录,安装极其简单,是一个完全免费的硬盘检测方案。

  • CentOS/RHEL 7/8/9

    yum install smartmontools -y   # CentOS 7
    dnf install smartmontools -y   # CentOS 8+/Fedora
  • Ubuntu/Debian

    apt update && apt install smartmontools -y
  • 验证安装

    smartctl --version

安装后,smartd守护进程也会一并部署,可用于后台定时监控,但大部分场景下直接使用smartctl命令行就足够,如果执行时遇到“Device does not support SMART”类似错误,通常是因为硬盘通过RAID卡连接,需要指定设备类型,例如加上-d sat或者-d megaraid,N参数。

如何使用smartctl查看硬盘健康状态?

这个命令最常见的用法就是快速输出一份整体健康报告,让你一眼看出硬盘有没有“大毛病”。

查看所有硬盘设备列表

首先要知道系统里有哪些硬盘,可以用lsblkfdisk -l,但更直接的方法是:

smartctl --scan

它会列出所有可识别的硬盘设备,例如/dev/sda/dev/sdb,以及对应的磁盘类型(如satscsinvme),对于NVMe固态硬盘,设备路径一般为/dev/nvme0,命令用法类似。

获取整体健康报告

针对某块硬盘执行:

smartctl -H /dev/sda

linux smartctl是什么,怎么用?

输出会显示SMART overall-health self-assessment test result: PASSEDFAILED,如果显示PASSED,说明硬盘自我评估状态正常;如果FAILED,则表示硬盘已检测到严重问题,应立即备份数据并更换,但PASSED不代表完全健康,还需要查看详细属性。

输出所有S.M.A.R.T.信息

smartctl -A /dev/sda

smartctl -a /dev/sda

-A只输出属性表,-a则输出全部信息(包括设备信息、属性表、错误日志等),属性表是核心,通常包含数十个参数,后面会详细解读。

smartctl命令详解:常用参数组合

根据不同场景,smartctl可以搭配不同参数,完成信息查询、测试执行、属性监控等任务,下面梳理几个最常用的组合,并附上参数速查表。

参数 功能 示例
-i 查看设备基本信息 smartctl -i /dev/sda
-H 查看整体健康状态 smartctl -H /dev/sda
-A 查看S.M.A.R.T.属性表 smartctl -A /dev/sda
-a 查看所有信息(含日志) smartctl -a /dev/sda
-t short 执行短自检 smartctl -t short /dev/sda
-t long 执行长自检 smartctl -t long /dev/sda
-l error 查看错误日志 smartctl -l error /dev/sda
-l selftest 查看自检结果 smartctl -l selftest /dev/sda

基础信息查询

smartctl -i /dev/sda

显示设备型号、序列号、固件版本、传输模式、S.M.A.R.T.支持情况等,用来确认硬盘身份,避免操作错盘。

查看属性表并解读

smartctl -A /dev/sda

属性表每一行代表一个监控指标,由ID、属性名称、当前值、最差值、阈值、原始值等组成,关键字段:

  • VALUE(当前值):标准化后的数值,通常从100开始向下递减,越接近阈值风险越大。
  • WORST(最差值):历史记录中的最低值。
  • THRESH(阈值):厂商设定的警戒线,当VALUE低于阈值时,代表该指标异常。
  • RAW_VALUE(原始值):实际物理计数,如坏扇区数量、通电小时数。

执行后台自检

smartctl -t short /dev/sda   # 短自检(2分钟左右)
smartctl -t long /dev/sda    # 长自检(数小时,取决于容量)
smartctl -t conveyance /dev/sda  # 传输自检(针对运输损伤)

自检开始后,可以用smartctl -l selftest /dev/sda查看结果,如果自检失败,通常意味着硬盘存在物理损伤。

linux smartctl是什么,怎么用?

查看错误日志

smartctl -l error /dev/sda

输出盘片记录的读写错误历史,如果近期频繁出现错误,即便当前属性值正常,也需警惕。

启用/禁用S.M.A.R.T.

smartctl -s on /dev/sda   # 启用
smartctl -s off /dev/sda  # 禁用

一般出厂默认开启,但某些老服务器或RAID卡可能默认关闭,需要手动开启。

smartctl检测硬盘寿命:从数据看懂硬盘还能撑多久

硬盘寿命预测不是玄学,而是通过关键S.M.A.R.T.属性来判断,下面这些ID是“死亡预警”的核心指标,尤其在国内数据中心日常巡检中,运维团队会重点监控这几项。

必须盯紧的五个属性

  • ID 5 – Reallocated_Sector_Ct(重映射扇区数)
    硬盘内部将坏扇区重新映射到备用扇区的次数,原始值若持续增长,说明盘片表面出现物理损伤,备份数据刻不容缓。

  • ID 197 – Current_Pending_Sector(当前待处理扇区数)
    硬盘读取时遇到不稳定但尚未重映射的扇区,数值不为零且持续增加,即使当前VALUE正常,也是硬盘即将报废的强烈信号。

  • ID 198 – Offline_Uncorrectable(离线无法纠正的扇区数)
    读写时无法纠正的扇区数量,一旦出现,硬盘可靠性已严重下降,多数情况下建议立即更换。

  • ID 187 – Reported_Uncorrect(报告无法纠正的错误数)
    通过ECC无法恢复的错误次数,该指标上升,表明磁头或盘片介质存在缺陷。

  • ID 190 – Airflow_Temperature_Cel(或Temperature_Celsius)
    硬盘温度,机械硬盘超过50°C、固态硬盘超过70°C会加速老化,这个指标虽然不直接指向寿命,但长期高温会使故障率上升。

如何判断“还能用多久”?

没有一个绝对的时间公式,但有一条经验法则:当ID 5和ID 197的原始值同时大于0,且呈增长趋势,就应该在两周内完成数据迁移和更换。 如果ID 198出现任何非零值,则应立即停机更换。

可以用一个简单的脚本持续记录这些值,观察趋势:

#!/bin/bash
# 记录关键SMART指标到日志
date >> /var/log/smart_watch.log
for dev in /dev/sd[a-z]; do
  smartctl -A $dev | grep -E "Reallocated_Sector_Ct|Current_Pending_Sector|Offline_Uncorrectable|Temperature_Celsius" >> /var/log/smart_watch.log
done

配合cron每天执行,就能形成趋势图。

实战:用smartctl搭建自动化硬盘监控脚本

手动检查太累,我们完全可以写一个简单的监控脚本,结合cron定时任务,当硬盘出现异常时主动发送邮件或企微/钉钉告警,这个方案在国内很多机房托管服务器上被广泛采用,成本为零,可靠性却很高。

linux smartctl是什么,怎么用?

脚本思路

  1. 遍历所有SATA/SAS硬盘(可从/dev/disk/by-path/smartctl --scan获得)。
  2. 对每块硬盘执行smartctl -H,检查PASSED状态。
  3. 提取关键属性ID 5、197、198的原始值,与预设阈值比较。
  4. 异常时调用告警命令(如mailcurl发送webhook)。

示例脚本(简化版)

#!/bin/bash
ALERT_LOG="/tmp/smart_alert.log"
> $ALERT_LOG
for disk in /dev/sd[a-z]; do
  if smartctl -H $disk | grep -q "FAILED"; then
    echo "$disk SMART Health FAILED!" >> $ALERT_LOG
  fi
  # 检查待处理扇区
  pending=$(smartctl -A $disk | grep "Current_Pending_Sector" | awk '{print $NF}')
  if [ -n "$pending" ] && [ "$pending" -gt 0 ]; then
    echo "$disk has $pending pending sectors!" >> $ALERT_LOG
  fi
done
if [ -s $ALERT_LOG ]; then
  mail -s "SMART Alert on $(hostname)" admin@example.com < $ALERT_LOG
fi

将此脚本加入/etc/crontab,每天凌晨2点执行一次:

0 2    root /path/to/script.sh

这样就能实现无人值守的硬盘健康监控,特别适合运行着多块硬盘的NAS、文件服务器或数据库服务器。

smartctl是Linux世界里最直接、最透明的硬盘健康检测工具,没有之一,它不依赖复杂的图形界面,一条命令就能直击要害,对于运维人员来说,与其等硬盘坏了再手忙脚乱地恢复数据,不如每天花几秒钟扫一眼S.M.A.R.T.属性,把灾难扼杀在萌芽里。

linux smartctl常见问题解答

怎么用smartctl检测硬盘寿命?

检测硬盘寿命主要观察几个关键S.M.A.R.T.属性:重映射扇区数(ID 5)、当前待处理扇区数(ID 197)、离线无法纠正扇区数(ID 198),执行smartctl -A /dev/sda,查看这三个属性的RAW_VALUE列,如果ID 5或ID 197持续增长,说明硬盘盘片已出现物理损伤;ID 198出现非零值则代表坏扇区已无法修复,需立即更换。

smartctl和badblocks的区别是什么?

smartctl读取的是硬盘内部固件记录的S.M.A.R.T.数据,属于被动监控,不产生额外磨损,反映的是硬盘全生命周期的状态,badblocks则是主动对磁盘表面进行读写测试,可以发现文件系统不可见的坏块,但测试过程会全盘读写,对盘片有磨损,适合在新盘或怀疑有坏道时进行销毁性验证,两者互补,通常先用smartctl筛查,再用badblocks确认。

linux smartctl命令详解在哪里看?

最权威的说明是内置的man手册,执行man smartctl即可查阅所有参数和用法,也可以访问smartmontools官网获取在线文档,对于中文用户,常见技术博客有大量参数翻译和案例,但版本迭代较快,建议以man手册为准。

首发原创文章,作者:王坚‌,如若转载,请注明出处:https://test.idctop.com/article/507650.html

(0)
免费的cdn加速哪个好?免费的cdn加速推荐
上一篇 2026年7月21日 01:02
CDN的部署方法有哪些?,cdn部署方法怎么选最好
下一篇 2026年7月21日 01:08

相关推荐

  • 新买的服务器怎么看公网IP?,详细步骤是什么?

    新买的服务器,公网IP地址通常可以在服务商提供的管理控制台、服务器自身命令行或网络设备配置中快速查到,最直接的方法就是登录服务器提供商的控制台,在实例详情页面找到公网IP信息,从云服务商控制台直接获取对于大多数云服务器用户,这是最省时省力的方法,登录你购买服务器的平台账号,进入云服务器管理页面,通常会有“实例……

    2026年8月24日
    000
  • Linux出现IO错误怎么办?Linux系统IO错误怎么解决

    Linux IO错误通常由硬件故障、文件系统损坏或驱动不兼容引起,首要步骤是通过dmesg和smartctl排查物理磁盘健康状态,并检查内核日志确认是底层硬件报错还是上层软件逻辑错误,当服务器突然响应迟缓,或者应用程序频繁抛出I/O错误时,许多运维人员的第一反应往往是恐慌,这种焦虑是可以理解的,因为IO错误直接……

    2026年7月7日
    12300
  • 4h8g服务器到底能承载多少用户,配置够用吗?

    4h8g服务器在常规Web应用场景下,日均可承载3000至8000个独立用户,峰值并发控制在200至500区间内表现稳定,但具体数值取决于应用架构、代码效率与数据库设计,先搞懂4h8g的真实含义4h8g指的是4核CPU与8GB内存的云服务器配置,这个规格在云计算市场中属于入门级到进阶级的分水岭,也是中小型项目最……

    2026年8月8日
    1400
  • 湖南衡阳南岳电信dns的服务器地址是多少

    湖南衡阳南岳电信的DNS服务器地址为:主DNS 202.103.96.68,备用DNS 202.103.96.112,这两个地址是湖南电信官方分配的省级通用DNS,南岳区电信宽带用户可直接使用,能保证域名解析的连通性和速度,湖南衡阳南岳电信DNS地址的来龙去脉这两个地址的官方背景202.103.96.68和20……

    2026年8月21日
    500
  • 服务等级协议的定义、内容和重要性是什么?,如何制定?

    服务等级协议包含哪些关键条款服务等级协议(SLA)是云服务和IT外包采购中不可或缺的契约文件,它直接定义了服务水平目标、测量方法和违约责任,是保障业务连续性的最后一道防线, 无论你是初次接触云服务,还是正在优化现有供应商管理,理解SLA的每个条款都能帮你避免很多隐性风险,服务等级协议包含哪些内容一份完整的服务等……

    2026年8月4日
    800
  • Linux下下载软件怎么操作?linux 下下载软件命令

    在Linux环境下下载文件,首选工具是wget和curl,前者适合后台断点续传大文件,后者适合API调试与轻量级请求,两者均无需图形界面即可高效完成资源获取,Linux系统以其稳定性和强大的命令行功能深受开发者喜爱,但在日常使用中,如何高效、安全地从互联网获取资源是一个高频需求,不同于Windows下双击安装包……

    2026年7月11日
    18300
  • Access数据库连接报错Access denied怎么办?Access数据库连接失败解决方法

    遇到“Access denied”报错,本质是身份验证失败或权限配置错误,解决核心在于排查账户密码匹配度、主机访问权限及防火墙设置,而非单纯重装软件,对于开发者而言,面对access数据库_连接数据库报错Access denied这一棘手问题,必须建立从用户层到网络层的系统化排查逻辑,避免盲目操作导致数据风险……

    2026年3月25日
    31400
  • Linux面试常问哪些难题?Linux面试高频考点汇总

    这是一份为您精心整理的 Linux 面试宝典涵盖了从基础命令到内核原理、故障排查及高并发场景下的实战经验,旨在帮助您在面试中从容应对,🐧 Linux 面试宝典 核心基础与常用命令文件与目录操作ls -l:查看详细信息,重点解释权限字段(rwx),-rw-r–r– 代表文件,drwxr-xr-x 代表目录,c……

    2026年7月12日
    1700
  • 租100m共享服务器多少钱

    租用100M共享服务器的价格通常在每月600元至2500元之间,具体取决于机房线路质量、带宽共享比以及服务商是否持牌自营,而非单纯看标价,影响100M共享服务器价格的核心因素100M共享服务器不是标准品,不同服务商报出的价格可能相差数倍,原因在于以下几个关键变量,带宽共享比与真实可用速率共享带宽的核心在于“共享……

    2026年8月17日
    300
  • authtoken是做什么用的?authToken取值规则详解

    authtoken本质上是系统颁发给用户身份的“数字通行证”,其核心作用在于验证用户身份合法性与维持会话状态连续性,确保用户在登录后能够安全、无感地访问受保护资源,它替代了传统的用户名密码在每次请求中频繁传输的风险模式,是现代Web应用与API接口交互中保障数据安全的关键机制,理解authtoken是做什么用的……

    2026年3月16日
    12600

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注