理解 smartctl -a 输出

Dan*_*Dan 13 smart seagate smartctl

我的 NAS 盒中有 6 个驱动器。其中两个是希捷,他们返回高 RAW_VALUES 错误;见下文。

我的其他驱动器显示的值要低得多。

这是报警的原因吗?或者只是希捷报告的方式?

看看Raw_Read_Error_RateSeek_Error_Rate

# smartctl -a /dev/ada1
=== START OF INFORMATION SECTION ===
Device Model:     ST3000DM001-9YN166
Serial Number:    W1F09S26
LU WWN Device Id: 5 000c50 0456076fc
Firmware Version: CC4C
User Capacity:    3,000,592,982,016 bytes [3.00 TB]
Sector Sizes:     512 bytes logical, 4096 bytes physical
Device is:        Not in smartctl database [for details use: -P showall]
ATA Version is:   8
ATA Standard is:  ATA-8-ACS revision 4
Local Time is:    Sat Aug 18 17:34:24 2012 EDT
SMART support is: Available - device has SMART capability.
SMART support is: Enabled

=== START OF READ SMART DATA SECTION ===
SMART overall-health self-assessment test result: PASSED

General SMART Values:
Offline data collection status:  (0x82) Offline data collection activity
                    was completed without error.
                    Auto Offline Data Collection: Enabled.
Self-test execution status:      ( 249) Self-test routine in progress...
                    90% of test remaining.
Total time to complete Offline 
data collection:        (  575) seconds.
Offline data collection
capabilities:            (0x7b) SMART execute Offline immediate.
                    Auto Offline data collection on/off support.
                    Suspend Offline collection upon new
                    command.
                    Offline surface scan supported.
                    Self-test supported.
                    Conveyance Self-test supported.
                    Selective Self-test supported.
SMART capabilities:            (0x0003) Saves SMART data before entering
                    power-saving mode.
                    Supports SMART auto save timer.
Error logging capability:        (0x01) Error logging supported.
                    General Purpose Logging supported.
Short self-test routine 
recommended polling time:    (   1) minutes.
Extended self-test routine
recommended polling time:    ( 255) minutes.
Conveyance self-test routine
recommended polling time:    (   2) minutes.
SCT capabilities:          (0x3085) SCT Status supported.

SMART Attributes Data Structure revision number: 10
Vendor Specific SMART Attributes with Thresholds:
ID# ATTRIBUTE_NAME          FLAG     VALUE WORST THRESH TYPE      UPDATED  WHEN_FAILED RAW_VALUE
  1 Raw_Read_Error_Rate     0x000f   111   099   006    Pre-fail  Always       -       34053632
  3 Spin_Up_Time            0x0003   093   092   000    Pre-fail  Always       -       0
  4 Start_Stop_Count        0x0032   100   100   020    Old_age   Always       -       32
  5 Reallocated_Sector_Ct   0x0033   100   100   036    Pre-fail  Always       -       0
  7 Seek_Error_Rate         0x000f   060   055   030    Pre-fail  Always       -       21480133713
  9 Power_On_Hours          0x0032   097   097   000    Old_age   Always       -       2696
 10 Spin_Retry_Count        0x0013   100   100   097    Pre-fail  Always       -       0
 12 Power_Cycle_Count       0x0032   100   100   020    Old_age   Always       -       32
183 Runtime_Bad_Block       0x0032   100   100   000    Old_age   Always       -       0
184 End-to-End_Error        0x0032   100   100   099    Old_age   Always       -       0
187 Reported_Uncorrect      0x0032   100   100   000    Old_age   Always       -       0
188 Command_Timeout         0x0032   100   100   000    Old_age   Always       -       0
189 High_Fly_Writes         0x003a   100   100   000    Old_age   Always       -       0
190 Airflow_Temperature_Cel 0x0022   064   061   045    Old_age   Always       -       36 (Min/Max 34/38)
191 G-Sense_Error_Rate      0x0032   100   100   000    Old_age   Always       -       0
192 Power-Off_Retract_Count 0x0032   100   100   000    Old_age   Always       -       28
193 Load_Cycle_Count        0x0032   100   100   000    Old_age   Always       -       63
194 Temperature_Celsius     0x0022   036   040   000    Old_age   Always       -       36 (0 19 0 0)
197 Current_Pending_Sector  0x0012   100   100   000    Old_age   Always       -       0
198 Offline_Uncorrectable   0x0010   100   100   000    Old_age   Offline      -       0
199 UDMA_CRC_Error_Count    0x003e   200   200   000    Old_age   Always       -       0
240 Head_Flying_Hours       0x0000   100   253   000    Old_age   Offline      -       43748536879750
241 Total_LBAs_Written      0x0000   100   253   000    Old_age   Offline      -       2867098636991
242 Total_LBAs_Read         0x0000   100   253   000    Old_age   Offline      -       17478042509157

SMART Error Log Version: 1
No Errors Logged

SMART Self-test log structure revision number 1
Num  Test_Description    Status                  Remaining  LifeTime(hours)  LBA_of_first_error
# 1  Extended offline    Self-test routine in progress 90%      2696         -

SMART Selective self-test log data structure revision number 1
 SPAN  MIN_LBA  MAX_LBA  CURRENT_TEST_STATUS
    1        0        0  Not_testing
    2        0        0  Not_testing
    3        0        0  Not_testing
    4        0        0  Not_testing
    5        0        0  Not_testing
Selective self-test flags (0x0):
  After scanning selected spans, do NOT read-scan remainder of disk.
If Selective self-test is pending on power-up, resume after 0 minute delay.
Run Code Online (Sandbox Code Playgroud)

Fal*_*mot 7

我发现自检结果非常可靠,并且它们是不言自明的(最后一次运行失败或通过)。

各种特定于供应商的属性就是这样。实际上没有标准化的方法来解释它们(这就是为什么 smartmon 工具维护一个包含这些值解释的驱动器数据库)。您可以在此处找到许多 if 标志含义的描述: https: //en.wikipedia.org/wiki/Self-Monitoring,_Analysis_and_Reporting_Technology#Known_ATA_S.MART_attributes

该线SMART overall-health self-assessment test result: PASSED源自打印在其下方的值,经过转换、标准化并由驱动器数据库给出阈值。

对于标准化值,通常越低越好,但并非所有标志都表明其本身预示着机械故障(具有阈值的标志更有可能)。诸如不可纠正的读取错误、启动失败等可能是指标。

从这些结果来看,您的驱动器看起来状态良好。


小智 6

Seagate 使用 SER (Seek_Error_Rate) 对两个不同的计数器进行编码:16 个高权重位用于查找错误计数,32 个低权重位用于查找计数。您希望使用十六进制显示来方便读取这两个计数器(6 个半字节 = 2 表示错误计数 + 4 表示查找计数)。

RRER (Raw_Read_Error_Rate) 不显示增量计数器,而是显示类似-10 log 的结果(错误扇区数/磁盘上的总位数)的结果,这解释了存在最小值和最大值。保持在最大值附近更好。

有关于此的更多说明:http://www.users.on.net/~fzabkar/HDD/Seagate_SER_RRER_HEC.html


sxc*_*731 5

我的盒子上的手册页提供了一位作者在 Linux Journal 上smartctl发表的文章的链接;特别是,清单 3 解释了 的输出。 smartctl -a

尽管它已经有 10 多年的历史了,但读完后我发现它仍然具有相关性,并且提供了权威的解释。


Ken*_*ick 2

我所做的是检查读取 hwecc 和查找错误率。我还会检查以确保不存在已重新定位或待处理的扇区。在获得前 3 个的 # 后,我在驱动器之间进行了大量复制,然后再次检查 #。如果它们没有大幅上涨,我会密切关注驱动器。如果他们开枪,我会打电话给供应商,看看需要做什么才能获得 rma。

我有一个 3 年的旧驱动器,有 23441590 读取错误 206428348 查找和 27659067 ecc。顺便说一句,这是在 hrs 上供电的。我的 5.5 年旧驱动器有 0 0 687123415 ecc。智能故障是一个可怕的早期预警系统,但这些数字可用于监视驱动器。我发现很少有驱动器能够在故障发生之前进行智能预测。另外仅供参考,我的 3 年旧硬盘是希捷硬盘,5 年硬盘是三星硬盘,希捷运行得很热:/我当前运行的所有希捷硬盘都有很多错误,而我的大多数其他品牌则没有。

另一件要做的事情是偶尔对你的驱动器进行基准测试。HDD Tune 是 Windows 的一个很好的例子。如果您在没有交换文件或从图形启动的驱动器上运行它,可以告诉您是否有任何区域存在读取问题。现代驱动器的读取速率通常从 50MB+ 上升到 25MB 左右。如果突然下跌,则该区域可能存在疲软或不良的部门。如果您每月或每三个月对驱动器进行一次基准测试,那么如果突然发生什么情况,您就可以有一个好主意。D4xx 纬度就是一个很好的例子。当驱动器控制器开始出现故障时,读取速率将从 5mb 左右开始,偶尔会升至 10mb 以上,因此我们总是对这些驱动器进行 rma 处理。您可能必须从 bartpe 磁盘或类似磁盘启动,以确保测试时没有其他东西正在使用该驱动器。

我经常使用这些结果加上硬盘调整等来在驱动器完全失效之前对其进行 rma 操作。