我认为用于冗余目的的 DNS 主要/次要很简单。我的理解是你应该有一个主要的和至少一个次要的,并且你应该在不同的地理位置设置你的次要,但也要在不同的路由器后面(例如参见https://serverfault.com/questions/48087 /why-are-there-several-nameservers-for-my-domain )
目前,我们的主数据中心有两个名称服务器。最近,由于各种原因,我们遇到了一些中断,这两个名称服务器都被关闭了,让我们和我们的客户在几个小时内无法使用 DNS。我已经要求我的系统管理员团队在另一个数据中心完成 DNS 服务器的设置并将其配置为辅助名称服务器。
但是,我们的系统管理员声称,如果其他数据中心至少不如主数据中心可靠,那么这也无济于事。他们声称,当主数据中心停机时,大多数客户端仍然无法正常查找,或者超时时间过长。
就我个人而言,我确信我们不是唯一一家遇到此类问题的公司,而且很可能已经解决了这个问题。我无法想象所有这些互联网公司都会受到我们这种问题的影响。但是,我找不到很好的在线文档来解释失败情况下会发生什么(例如,客户端超时)以及如何解决这些问题。
我可以用什么论据来戳破我们系统管理员的推理?我可以参考任何在线资源以更好地了解他们声称存在的问题?
阅读回复后的一些补充说明:
我有一个机架式服务器,其冗余电源插入了两个 APC Smart-UPS 3000 XLM。每个 UPS 都连接到两个不同的主电源。
两个 apcupsd 实例正在运行,每个实例都连接到自己的 UPS。它们都可以检测 UPS 何时使用电池,然后每个 UPS 都可以触发服务器关机。
问题是:如果只有一个 UPS 电池耗尽,如何不关机?
注意:Smart-UPS 3000 XLM 具有“电源同步”功能,可以连接到对端并检测其状态。但是当我从其中一个中拔出插头时,无论如何都发送了关机命令。我正在考虑修改关闭脚本以检查“apcaccess”是否其他 ups 已关闭。任何这方面的经验将不胜感激!
有没有办法让 DNS 协议自然地保存一个备份 A 记录服务器地址,比如备份名称服务器或邮件服务器记录?搜索时,我只看到备份名称服务器(NS 记录)上的结果。
如果 DNS 没有办法支持备份 A 记录,那么模拟结果的最佳方法是什么,以便在主服务器没有响应的情况下将用户定向到工作服务器?
我对使用 vSphere 集群时站点冗余的最佳设计有疑问。不过,首先要了解一些有关我们情况的背景信息。
我们是一家中型公司,在不同国家设有两个主要办事处。我们的网络由当前未充分利用的第 2 层 150Mbps 租用线路连接。我们有多种服务供公司内部使用,一些在物理服务器上,一些在现有的 vSphere 集群上。在我们部门,我们也运行着NTP、Syslog、跳转服务器、监控服务器等多种服务(几乎都运行在各种形式的Linux下)。
我们现在要求这些服务器需要在每个位置都是冗余的(它们目前还不是),并且还需要站点冗余(在某种程度上,服务器在第二个位置复制,配置通过以下方式保持同步)应用层的各种方法)。没有可供我们使用的 SAN,至少我们目前无法使用。
成本也是一个问题。虽然我们确实有一些可用的预算,但例如,我们负担不起为这两个地点购买 SAN。
我查看了 VSA 功能,似乎这对我们有用,但我不确定如何解决站点冗余要求。
目前,出于测试目的,我正在实验室中在两台 ESXi 主机上设置带有 VSA 的 vSphere 5。我目前正在使用带有 VSA 许可证的 Essentials Plus 套件,它允许我在最多 3 台主机上构建 VSA 群集,并使用 vCenter 许可证来管理它们。每个主机都有两个双端口网卡和两个 600GB 驱动器,在 Raid1 中运行。在硬件方面,这足以让我们将所需的所有服务作为 VM 运行,并将在站点内提供冗余。
目前,我只看到两种具有站点冗余的选项:
我非常喜欢第二个选项,但我不确定它会如何工作,如果它可以工作的话。从技术上讲,我们应该可以跨租用线路跨越所需的 VLAN,并让它们在第二个位置可用。优点是我们根本不需要担心同步数据库等。但是感觉带宽不够用,不知道VSA集群会在主机之间产生多少流量。我意识到这很可能取决于 VM 的个人使用情况,但我仍然不知道 VSA 如何在 ESXi 主机之间复制数据。
这些是我唯一的选择还是可以通过其他方式实现我的目标?有没有办法在第二个位置设置某种“冷备用”集群,每晚从主位置同步一次虚拟机?这个想法是,如果第一个站点不可用,我们将能够将所有这些 VM 联机到那里。我们可以接受 1 天前的数据。
任何答案表示赞赏。
最好的问候,斯蒂芬
假设我有给定域的 2 个 IP(循环 DNS)。
如果一个 IP 变得无响应,客户端是否会尝试连接到另一个 IP?或者他们将无法与域建立通信?
domain-name-system high-availability redundancy fault-tolerance round-robin
我有一个 Supermicro 冗余电源,里面有两个单元。我还有两个 UPS 单元,每个电源一个。我正在查看 UPS 上的 LCD 以了解瓦特使用情况。总瓦数约为 400 瓦。这就是奇怪的地方。我观察到以下情况,这是我在其他 30 个 Supermicro 冗余电源设置中没有看到的。
It starts with...
UPS1 200 Watts UPS2 200 Watts.
Stays the same for 3 seconds and then changes with in a second to...
UPS1 0 Watts UPS2 400 Watts.
Stays the same for 3 seconds and then changes with in a second to...
UPS1 200 Watts UPS2 200 Watts.
Stays the same for 3 seconds and then changes with in a second to...
UPS1 400 …Run Code Online (Sandbox Code Playgroud) 我对 Ceph 很陌生,并试图找出 Ceph 是否支持硬件级别的raid HBA。
可惜找不到任何资料。我发现,建议对 OSD 使用普通磁盘。但这将要求推到了 PCIe、磁盘接口到高带宽和 CPU 要求非常高。
硬件 RAID 控制器已经解决了这些要求,它们根据设置提供高冗余,而不会占用我的 PCIe、CPU 或任何其他资源。
所以我希望的设置是拥有本地 RAID 控制器,无论我需要什么 RAID 级别,它都可以在控制器级别(Raid 5、raid 6)处理我的磁盘冗余。除了 RAID LUN 之外,我还想使用 Ceph 在以下对象之间进行更高级别的复制:主机、机箱、机架、行、数据中心或 CRUSH 中可能或可计划的任何内容
我们有几个主机,其中有一个相同的热备用主机,该主机已打补丁和更新,因此非常接近具有相同的软件和配置。万一出现故障,网络电缆会被切换,DHCP 服务器会更新为新的 MAC 地址。这是最好的情况,因为通常还有更多需要修改的地方。
我觉得有一个热备主机很浪费电,浪费时间去维护它,而且因为在故障转移的情况下需要修改配置,所以我想问以下问题:
热备用主机是否过时,现在有更好的方法吗?
与其使用热备用主机,不如将其设为冷备用,将硬盘驱动器放入主主机并将 RAID 从 1 更改为 1+1 是否有意义。如果出现故障,我所要做的就是更换网线、更新 DHCP 服务器、取出硬盘驱动器并将它们插入冷备用并打开电源。在我看来,好处是 2x2 磁盘始终同步,因此在故障转移时只需要维护一台主机并且不需要更改配置。
这是一个好主意吗?
我知道 ZFS 更喜欢所有具有相同大小的磁盘。但是,如果我有两个不同大小的磁盘(1TB 和 1.5TB),我希望有一定的冗余,但不是镜像。所以我把两个磁盘分成 5 个分区,每个分区大约 500GB 并创建一个“raidz”池……zfs 高兴地答应了。它的设置实际上会增加任何可靠性吗?我的想法是,如果磁盘没有完全损坏,并且只有一部分出现故障,我仍然可以访问数据吗?
简短而甜蜜,我认为您不需要比这更多的细节:
我们在内部网络服务器上托管我们的网站。
当网络进/出我们建筑物的通信停止时,灾难已经并将再次发生。
发生这种情况时,我们希望我们的用户在尝试访问我们的网站时至少看到某种 “停机维护”或其他消息(twitter 的失败鲸鱼?),而不是当前“未找到服务器” 类型的消息他们目前得到。(静态服务器,所有请求的临时重定向)。
[能够故障转移到功能齐全的网站会很棒,但不是必需的,也可能不是一种选择]。
显然,当我们的本地服务器关闭时,必须有某种异地故障转移可以接管。
这样的解决方案是如何实施的?其他建议?
编辑:如果我没有为此使用(或遗漏)一些正确的术语,请告诉我!
redundancy ×10
linux ×3
failover ×2
apcupsd ×1
ceph ×1
hardware ×1
raid ×1
round-robin ×1
ups ×1
vmware-esxi ×1
web-server ×1
zfs ×1