我是一名软件工程师,而不是系统管理员,所以如果这个问题看起来有点生疏,你知道为什么!;-)
作为一个个人项目,我一直在使用FreeNAS 开发家庭 NAS 系统。FreeNAS 的功能之一是能够设置 SMART 检查以运行 X 秒。默认情况下,这设置为每 1800 秒(30 分钟)运行一次。虽然这对我来说似乎很高,但这真的是一个合理的价值吗?我认为每 6 小时检查一次或其他事情就足够合理了...
所以我的问题是:应该多久在驱动器上运行一次 SMART 检查?
在一周的过程中,对于 3TB 希捷硬盘 (ST3000DM001-1CH166),smartd 报告了离线不可纠正和当前不可读(待处理)扇区的数量缓慢增加,然后减少的数量,直到最终计数为 0 并且出现错误情况重启。从日志(仅显示更改):
Jul 6 18:04:57 x smartd[462]: Device: /dev/sdb [SAT], 8 Currently unreadable (pending) sectors
Jul 6 18:04:58 x smartd[462]: Device: /dev/sdb [SAT], 8 Offline uncorrectable sectors
[...]
Jul 7 16:34:58 x smartd[462]: Device: /dev/sdb [SAT], 16 Currently unreadable (pending) sectors (changed +8)
Jul 7 16:34:58 x smartd[462]: Device: /dev/sdb [SAT], 16 Offline uncorrectable sectors (changed +8)
[...]
Jul 11 14:04:57 x smartd[462]: Device: /dev/sdb [SAT], 24 Currently unreadable (pending) sectors (changed +8)
Jul 11 …Run Code Online (Sandbox Code Playgroud) 我有一个标志着一个ZFS存储阵列“失败”两次,因为注意到英特尔X-25M驱动器在这里。但是,在移除驱动器后,它似乎在其他计算机(Mac、PC、USB 机箱等)上挂载、读取和写入。
是否有确定驱动器当前健康状况的好方法?我觉得之前 ZFS 解决方案的失败是错误、错误报告和硬件的收敛。不过,这个驱动器似乎有一些生命力。
我的 NAS 盒中有 6 个驱动器。其中两个是希捷,他们返回高 RAW_VALUES 错误;见下文。
我的其他驱动器显示的值要低得多。
这是报警的原因吗?或者只是希捷报告的方式?
看看Raw_Read_Error_Rate和Seek_Error_Rate:
# smartctl -a /dev/ada1
=== START OF INFORMATION SECTION ===
Device Model: ST3000DM001-9YN166
Serial Number: W1F09S26
LU WWN Device Id: 5 000c50 0456076fc
Firmware Version: CC4C
User Capacity: 3,000,592,982,016 bytes [3.00 TB]
Sector Sizes: 512 bytes logical, 4096 bytes physical
Device is: Not in smartctl database [for details use: -P showall]
ATA Version is: 8
ATA Standard is: ATA-8-ACS revision 4
Local Time is: Sat Aug …Run Code Online (Sandbox Code Playgroud) 我想知道这个 SMART 自检的结果是否表明驱动器出现故障,这是唯一一个在结果中出现“已完成:读取失败”的驱动器。
# smartctl -l selftest /dev/sde
smartctl version 5.38 [i686-pc-linux-gnu] Copyright (C) 2002-8 Bruce Allen
Home page is http://smartmontools.sourceforge.net/
=== START OF READ SMART DATA SECTION ===
SMART Self-test log structure revision number 1
Num Test_Description Status Remaining LifeTime(hours) LBA_of_first_error
# 1 Extended offline Completed: read failure 90% 8981 976642822
# 2 Extended offline Aborted by host 90% 8981 -
# 3 Extended offline Completed: read failure 90% 8981 976642822
# 4 Extended offline Interrupted (host reset) 90% …Run Code Online (Sandbox Code Playgroud) 我有一台 300G Western Digital Raptor,最近显示 UNC SMART,想知道有经验的人知道我应该更换它并获得 WD 保修吗?
smartctl -a 详情如下:
smartctl 5.41 2011-06-09 r3365 [FreeBSD 8.2-RELEASE-p6 amd64] (local build)
Copyright (C) 2002-11 by Bruce Allen, http://smartmontools.sourceforge.net
=== START OF INFORMATION SECTION ===
Model Family: Western Digital VelociRaptor
Device Model: WDC WD3000HLFS-01G6U0
Serial Number: WD-WXD0C79C8807
LU WWN Device Id: 5 0014ee 0ac3cfaf0
Firmware Version: 04.04V01
User Capacity: 300,069,052,416 bytes [300 GB]
Sector Size: 512 bytes logical/physical
Device is: In smartctl database [for details use: -P show]
ATA Version is: …Run Code Online (Sandbox Code Playgroud) 在 Linux 下,我们可以smartmontools通过驱动器是作为普通块设备还是通用设备(当驱动器已被某些控制器(例如 IBM HS22 上的控制器)进行硬件 RAID 时会发生这种情况)来轻松监控 SSD 磨损。
我们如何在 Windows 下做等效的事情?真的有人用smartmontools吗?或者还有其他的包吗?
问题是 SCSI 通用设备在 Windows 中不显示。如果驱动器没有经过 RAID,我们可以看到它们正常。
我将如何在 Linux 中做到这一点:
sles11-live:~ # lsscsi -g
[1:0:0:0] disk SMART USB-IBM 8989 /dev/sda /dev/sg0
[2:0:0:0] disk ATA MTFDDAK256MAR-1K MA44 - /dev/sg1
[2:0:1:0] disk ATA MTFDDAK256MAR-1K MA44 - /dev/sg2
[2:1:8:0] disk LSILOGIC Logical Volume 3000 /dev/sdb /dev/sg3
sles11-live:~ # smartctl -l ssd /dev/sg1
smartctl 5.42 2011-10-20 r3458 [x86_64-linux-2.6.32.49-0.3-default] (local build)
Copyright (C) 2002-11 by Bruce Allen, http://smartmontools.sourceforge.net
Device …Run Code Online (Sandbox Code Playgroud) 使用 SMART(例如使用 smartctl 工具)测试硬盘时,我可以在两种模式下进行测试(例如长时间测试):俘虏(也称为前台模式)或非俘虏。非俘虏模式更方便,因为它不会阻塞硬盘。那么俘虏模式的目的是什么?在什么情况下我应该更喜欢它而不是非俘虏模式?
我使用 SMART 自检来测试我所有的硬盘驱动器和 SSD。我每天进行一次短期测试,每月进行一次长期测试。
我的一个 SSD 显示出奇怪的行为,因为生命周期时间似乎重置为零。这是正常的吗?为什么要这样做?我以前从未见过这种行为。这是一个令人担忧的原因吗?
我用来启动测试的命令(通过 crontab 启动的脚本)是:
smartctl --test=short $DISK
Run Code Online (Sandbox Code Playgroud)
这是显示奇怪行为的错误日志的副本:
smart self-test log structure revision number 1
num test_description status remaining lifetime(hours) lba_of_first_error
# 1 short offline completed without error 00% 110 -
# 2 short offline completed without error 00% 86 -
# 3 short offline completed without error 00% 62 -
# 4 short offline completed without error 00% 38 -
# 5 short offline completed without error 00% 14 -
# 6 short …Run Code Online (Sandbox Code Playgroud) 我有一对 RAID1 磁盘,格式为btrfs.
磁盘会定期进行清理,我会收到结果通知。他们已经运行了大约 2-3 年,没有出现任何问题。
然而,我最近添加smartd到我的安装中,它立即抱怨其中一个驱动器中有少量不可读的扇区:
Device: /dev/sdc [SAT], 4 Currently unreadable (pending) sectors
Run Code Online (Sandbox Code Playgroud)
我对该驱动器进行了擦洗,发现并纠正了相同数量的错误,但智能错误消息并没有消失。对同一磁盘的后续擦洗不会显示任何错误。
我不确定这些工具中哪个最准确 - 是smartd显示误报,还是btrfs缺少坏扇区,或者也许我误解了结果?
验证磁盘运行状况的最佳方法是什么?
谢谢!