假设我正在设置单机服务器。在不知道其中的特定组件(并且能够查找其 MTBF)的情况下,服务器中硬件组件的典型相对故障率是多少?
同样,企业使用的所有服务器中最常更换组件的排名是什么?
一些背景。
几周前,在没有进行太多故障排除的情况下更换了一个盒子上的网卡,以找到问题的明确解决方案。一位高级管理员与一位初级管理员因硬件中断和以太网卡发生了小争执。具体来说,它们是如何工作的。初级管理员给出了一个含糊的答案,坚称自己是正确的,事情就这样结束了,没有真正的结论。
理论上我知道硬件中断是如何工作的,但是当网卡接收到信息包时它具体是如何工作的呢?硬件层面发生了什么?如何正确诊断是否发生了物理损坏,以避免本质上相当于扔零件解决问题?
供应商(数据中心)建议我在带有机械驱动器的硬件 RAID 10 上的软件 RAID 1 中使用 1TB SSD。
他们的报价:
通常 SSD 比 RAID 卡最可靠,而且由于部件较少,故障点也较少。由于 RAID1 是极其简单的存储,因此不会有太多 CPU 负载。
这有多真实?在运行虚拟机时,RAID 1 SW 甚至是理想的选择吗?他们是这么说的。
更多细节: 我计划运行 XEN/XEN-HvM/KVM —— 换句话说,它将 Linux 作为主机运行,我想要一个设置,来宾可以将 Windows 托管到 Linux 并可以编译他们自己的内核。
我想要完成的是: 能够快速识别驱动器故障并在几乎没有停机时间或性能下降的情况下更换。
我在使用 HP ProLiant DL380 G7 时遇到了问题,这让我没有太多的故障排除方法。
此服务器将无法启动。它存储在数据中心中,在无法连接并且 colo 技术人员无法重新启动它后,我去检索它。它基本上会闪烁所有硬盘驱动器和系统运行状况指示灯,并且在无法访问系统或通过按住电源按钮重新启动系统后我拔掉了系统电源。从那以后,它什么也不做,只是电源 LED 呈橙色常亮,健康灯上没有任何活动。风扇不转,电源不亮,什么也没有发生。
我拔掉了所有的驱动器,只是试图用 CPU 和内存启动,但仍然没有。不过,以太网链接灯确实亮了。该系统具有双处理器和两个电源。好像是主板错误,但我不知道。
有人提到 PSU 背板有时会出现故障,这是有道理的,但只插入一个电源并检查每种配置可能性会产生相同的结果。
服务器已过保修期,我需要找到要更换的部件。有没有办法继续排除故障呢?系统安装了 iLO,但我不知道如何在无法将机器引导至 BIOS 的情况下访问它。
我想将 USB 驱动器安装到 VMWare ESXi 5.5 主机。
通过 lsusb 可以看到 USB 驱动器:
Bus 01 Device 03: ID 154b:0095 PNY
但不下/vmfs。
在/dev/disks/我看到很多条目,但不知道其中一个是否是我的 USB 磁盘:
mpx.vmhba32:C0:T0:L0 vml.0000000000766d68626133323a303a30
mpx.vmhba33:C0:T0:L0 vml.0000000000766d68626133333a303a30
mpx.vmhba33:C0:T0:L0:1 vml.0000000000766d68626133333a303a30:1
mpx.vmhba34:C0:T0:L0 vml.0000000000766d68626133343a303a30
mpx.vmhba34:C0:T0:L0:1 vml.0000000000766d68626133343a303a30:1
mpx.vmhba34:C0:T0:L0:5 vml.0000000000766d68626133343a303a30:5
mpx.vmhba34:C0:T0:L0:6 vml.0000000000766d68626133343a303a30:6
mpx.vmhba34:C0:T0:L0:7 vml.0000000000766d68626133343a303a30:7
mpx.vmhba34:C0:T0:L0:8 vml.0000000000766d68626133343a303a30:8
Run Code Online (Sandbox Code Playgroud)
dmesg 说:
2015-05-27T16:18:36.169Z cpu3:33302)<6>usb 1-6: New USB device found, idVendor=154b, idProduct=0095
2015-05-27T16:18:36.169Z cpu3:33302)<6>usb 1-6: New USB device strings: Mfr=1, Product=2, SerialNumber=3
2015-05-27T16:18:36.169Z cpu3:33302)<6>usb 1-6: Product: USB 3.0 FD
2015-05-27T16:18:36.169Z cpu3:33302)<6>usb 1-6: Manufacturer: PNY Technologies
2015-05-27T16:18:36.169Z …Run Code Online (Sandbox Code Playgroud) 我们即将构建一个新服务器,我想知道可用选项对 NUMA 有何影响。
该系统将使用 Proliant DL380 Gen9 8SFF 构建,它有 2 个插槽,每个插槽有 12 个内存组。
我的问题是什么会更好地配置 2 CPU 的 6 核和内存均匀分布在 NUMA 节点或单个 12 核 CPU 和该 NUMA 节点中的所有内存。
我是否应该期望使用单个 Intel Xeon E5-2690Wv3 和 192GB(4 * 32GB + 4 * 16GB)内存出现带宽问题并选择 2 CPU 选项,或者我应该避免复杂性并选择单 CPU 解决方案并让所有 RAM 坐下在分配给该套接字的银行中?
不会使用虚拟化,机器将运行 Windows 2012 R2 和 SQL 2014,两者都支持 NUMA。
如果我在 RAID 1 中有 2 个驱动器,并且 Raid 控制器出现故障,这是否意味着服务器上的网站将在更换控制器之前停机?或者在更换有故障的raid卡之前,一切仍会自动作为软件raid进行吗?
对于我还没有使用过的 Dell PowerEdge T310,我想知道它的 RAID 卡是否受使用“.deb”软件包(如 Debian 或 Ubuntu)的发行版支持。
在戴尔的网站上,我只能找到适用于 Red Hat(以及 CentOS、Fedora)或 Windows 的驱动程序,而找不到适用于 Debian 系列的驱动程序。
有没有人使用基于 H200 或 H700 卡的带有硬件 RAID 1 的 Dell PowerEdge T310?
为什么服务器一般启动速度这么慢?
如果其中有 1-2 TByte RAM,则冷启动服务器可能需要 10-20-30-40 分钟。这是为什么呢?平均来说记忆不是非常快吗?为什么“测试”(?)需要这么多时间?
有人可以帮助我分析我的/proc/interrupts文件输出中的数据吗?
$ cat /proc/interrupts
CPU0 CPU1
0: 22 0 IR-IO-APIC 2-edge timer
1: 2 0 IR-IO-APIC 1-edge i8042
8: 1 0 IR-IO-APIC 8-edge rtc0
9: 0 0 IR-IO-APIC 9-fasteoi acpi
12: 4 0 IR-IO-APIC 12-edge i8042
120: 0 0 DMAR-MSI 0-edge dmar0
122: 0 0 IR-PCI-MSI 327680-edge xhci_hcd
123: 25164 5760490 IR-PCI-MSI 1048576-edge enp2s0
124: 17 5424414 IR-PCI-MSI 524288-edge amdgpu
Run Code Online (Sandbox Code Playgroud)
到目前为止我编译的...
hardware ×10
raid ×3
hp-proliant ×2
interrupts ×2
boot ×1
debian ×1
dell-perc ×1
ethernet ×1
failed ×1
hard-drive ×1
hp ×1
linux ×1
networking ×1
nic ×1
numa ×1
redundancy ×1
sql-server ×1
ssd ×1
vmware-esxi ×1