Dan*_*Dan 13 smart seagate smartctl
我的 NAS 盒中有 6 个驱动器。其中两个是希捷,他们返回高 RAW_VALUES 错误;见下文。
我的其他驱动器显示的值要低得多。
这是报警的原因吗?或者只是希捷报告的方式?
看看Raw_Read_Error_Rate
和Seek_Error_Rate
:
# smartctl -a /dev/ada1
=== START OF INFORMATION SECTION ===
Device Model: ST3000DM001-9YN166
Serial Number: W1F09S26
LU WWN Device Id: 5 000c50 0456076fc
Firmware Version: CC4C
User Capacity: 3,000,592,982,016 bytes [3.00 TB]
Sector Sizes: 512 bytes logical, 4096 bytes physical
Device is: Not in smartctl database [for details use: -P showall]
ATA Version is: 8
ATA Standard is: ATA-8-ACS revision 4
Local Time is: Sat Aug 18 17:34:24 2012 EDT
SMART support is: Available - device has SMART capability.
SMART support is: Enabled
=== START OF READ SMART DATA SECTION ===
SMART overall-health self-assessment test result: PASSED
General SMART Values:
Offline data collection status: (0x82) Offline data collection activity
was completed without error.
Auto Offline Data Collection: Enabled.
Self-test execution status: ( 249) Self-test routine in progress...
90% of test remaining.
Total time to complete Offline
data collection: ( 575) seconds.
Offline data collection
capabilities: (0x7b) SMART execute Offline immediate.
Auto Offline data collection on/off support.
Suspend Offline collection upon new
command.
Offline surface scan supported.
Self-test supported.
Conveyance Self-test supported.
Selective Self-test supported.
SMART capabilities: (0x0003) Saves SMART data before entering
power-saving mode.
Supports SMART auto save timer.
Error logging capability: (0x01) Error logging supported.
General Purpose Logging supported.
Short self-test routine
recommended polling time: ( 1) minutes.
Extended self-test routine
recommended polling time: ( 255) minutes.
Conveyance self-test routine
recommended polling time: ( 2) minutes.
SCT capabilities: (0x3085) SCT Status supported.
SMART Attributes Data Structure revision number: 10
Vendor Specific SMART Attributes with Thresholds:
ID# ATTRIBUTE_NAME FLAG VALUE WORST THRESH TYPE UPDATED WHEN_FAILED RAW_VALUE
1 Raw_Read_Error_Rate 0x000f 111 099 006 Pre-fail Always - 34053632
3 Spin_Up_Time 0x0003 093 092 000 Pre-fail Always - 0
4 Start_Stop_Count 0x0032 100 100 020 Old_age Always - 32
5 Reallocated_Sector_Ct 0x0033 100 100 036 Pre-fail Always - 0
7 Seek_Error_Rate 0x000f 060 055 030 Pre-fail Always - 21480133713
9 Power_On_Hours 0x0032 097 097 000 Old_age Always - 2696
10 Spin_Retry_Count 0x0013 100 100 097 Pre-fail Always - 0
12 Power_Cycle_Count 0x0032 100 100 020 Old_age Always - 32
183 Runtime_Bad_Block 0x0032 100 100 000 Old_age Always - 0
184 End-to-End_Error 0x0032 100 100 099 Old_age Always - 0
187 Reported_Uncorrect 0x0032 100 100 000 Old_age Always - 0
188 Command_Timeout 0x0032 100 100 000 Old_age Always - 0
189 High_Fly_Writes 0x003a 100 100 000 Old_age Always - 0
190 Airflow_Temperature_Cel 0x0022 064 061 045 Old_age Always - 36 (Min/Max 34/38)
191 G-Sense_Error_Rate 0x0032 100 100 000 Old_age Always - 0
192 Power-Off_Retract_Count 0x0032 100 100 000 Old_age Always - 28
193 Load_Cycle_Count 0x0032 100 100 000 Old_age Always - 63
194 Temperature_Celsius 0x0022 036 040 000 Old_age Always - 36 (0 19 0 0)
197 Current_Pending_Sector 0x0012 100 100 000 Old_age Always - 0
198 Offline_Uncorrectable 0x0010 100 100 000 Old_age Offline - 0
199 UDMA_CRC_Error_Count 0x003e 200 200 000 Old_age Always - 0
240 Head_Flying_Hours 0x0000 100 253 000 Old_age Offline - 43748536879750
241 Total_LBAs_Written 0x0000 100 253 000 Old_age Offline - 2867098636991
242 Total_LBAs_Read 0x0000 100 253 000 Old_age Offline - 17478042509157
SMART Error Log Version: 1
No Errors Logged
SMART Self-test log structure revision number 1
Num Test_Description Status Remaining LifeTime(hours) LBA_of_first_error
# 1 Extended offline Self-test routine in progress 90% 2696 -
SMART Selective self-test log data structure revision number 1
SPAN MIN_LBA MAX_LBA CURRENT_TEST_STATUS
1 0 0 Not_testing
2 0 0 Not_testing
3 0 0 Not_testing
4 0 0 Not_testing
5 0 0 Not_testing
Selective self-test flags (0x0):
After scanning selected spans, do NOT read-scan remainder of disk.
If Selective self-test is pending on power-up, resume after 0 minute delay.
Run Code Online (Sandbox Code Playgroud)
我发现自检结果非常可靠,并且它们是不言自明的(最后一次运行失败或通过)。
各种特定于供应商的属性就是这样。实际上没有标准化的方法来解释它们(这就是为什么 smartmon 工具维护一个包含这些值解释的驱动器数据库)。您可以在此处找到许多 if 标志含义的描述: https: //en.wikipedia.org/wiki/Self-Monitoring,_Analysis_and_Reporting_Technology#Known_ATA_S.MART_attributes
该线SMART overall-health self-assessment test result: PASSED
源自打印在其下方的值,经过转换、标准化并由驱动器数据库给出阈值。
对于标准化值,通常越低越好,但并非所有标志都表明其本身预示着机械故障(具有阈值的标志更有可能)。诸如不可纠正的读取错误、启动失败等可能是指标。
从这些结果来看,您的驱动器看起来状态良好。
小智 6
Seagate 使用 SER (Seek_Error_Rate) 对两个不同的计数器进行编码:16 个高权重位用于查找错误计数,32 个低权重位用于查找计数。您希望使用十六进制显示来方便读取这两个计数器(6 个半字节 = 2 表示错误计数 + 4 表示查找计数)。
RRER (Raw_Read_Error_Rate) 不显示增量计数器,而是显示类似-10 log 的结果(错误扇区数/磁盘上的总位数)的结果,这解释了存在最小值和最大值。保持在最大值附近更好。
有关于此的更多说明:http://www.users.on.net/~fzabkar/HDD/Seagate_SER_RRER_HEC.html
我的盒子上的手册页提供了一位作者在 Linux Journal 上smartctl
发表的文章的链接;特别是,清单 3 解释了 的输出。 smartctl -a
尽管它已经有 10 多年的历史了,但读完后我发现它仍然具有相关性,并且提供了权威的解释。
我所做的是检查读取 hwecc 和查找错误率。我还会检查以确保不存在已重新定位或待处理的扇区。在获得前 3 个的 # 后,我在驱动器之间进行了大量复制,然后再次检查 #。如果它们没有大幅上涨,我会密切关注驱动器。如果他们开枪,我会打电话给供应商,看看需要做什么才能获得 rma。
我有一个 3 年的旧驱动器,有 23441590 读取错误 206428348 查找和 27659067 ecc。顺便说一句,这是在 hrs 上供电的。我的 5.5 年旧驱动器有 0 0 687123415 ecc。智能故障是一个可怕的早期预警系统,但这些数字可用于监视驱动器。我发现很少有驱动器能够在故障发生之前进行智能预测。另外仅供参考,我的 3 年旧硬盘是希捷硬盘,5 年硬盘是三星硬盘,希捷运行得很热:/我当前运行的所有希捷硬盘都有很多错误,而我的大多数其他品牌则没有。
另一件要做的事情是偶尔对你的驱动器进行基准测试。HDD Tune 是 Windows 的一个很好的例子。如果您在没有交换文件或从图形启动的驱动器上运行它,可以告诉您是否有任何区域存在读取问题。现代驱动器的读取速率通常从 50MB+ 上升到 25MB 左右。如果突然下跌,则该区域可能存在疲软或不良的部门。如果您每月或每三个月对驱动器进行一次基准测试,那么如果突然发生什么情况,您就可以有一个好主意。D4xx 纬度就是一个很好的例子。当驱动器控制器开始出现故障时,读取速率将从 5mb 左右开始,偶尔会升至 10mb 以上,因此我们总是对这些驱动器进行 rma 处理。您可能必须从 bartpe 磁盘或类似磁盘启动,以确保测试时没有其他东西正在使用该驱动器。
我经常使用这些结果加上硬盘调整等来在驱动器完全失效之前对其进行 rma 操作。
归档时间: |
|
查看次数: |
27297 次 |
最近记录: |