相关疑难解决方法(0)

多个数据中心和 HTTP 流量:DNS Round Robin 是确保即时故障转移的唯一方法吗?

指向同一个域的多个 A 记录似乎几乎专门用于将 DNS 轮询作为一种廉价的负载平衡技术来实现。

针对 DNS RR 的常见警告是它不利于高可用性。当 1 个 IP 出现故障时,客户端将继续使用它几分钟。

通常建议使用负载平衡器作为更好的选择。

这两种说法都不完全正确:

  1. 当流量为 HTTP 时,大多数 HTML 浏览器能够自动尝试下一条 A 记录(如果前一条记录出现故障),而无需进行新的 DNS 查找。阅读此章节3.1这里

  2. 当涉及多个数据中心时,DNS RR 是在它们之间分配流量的唯一选择。

那么,对于多个数据中心和 HTTP 流量,使用 DNS RR 是确保在一个数据中心出现故障时立即进行故障转移的唯一方法吗?

谢谢,

华伦天奴

编辑:

  • 当然,每个数据中心都有一个带有热备份的本地负载均衡器。
  • 为即时故障转移牺牲会话亲缘关系是可以的。
  • AFAIK DNS 建议数据中心而不是另一个数据中心的唯一方法是仅回复与该数据中心关联的 IP(或多个 IP)。如果数据中心变得无法访问,那么所有这些 IP 也无法访问。这意味着,即使智能 HTML 浏览器能够立即尝试另一个 A 记录,所有尝试都将失败,直到本地缓存条目过期并完成新的 DNS 查找,获取新的工作 IP(我假设 DNS 自动建议给一个一个失败时的新数据中心)。因此,“智能 DNS”不能保证即时故障转移。
  • 相反,DNS 循环允许它。当一个数据中心出现故障时,智能 HTML 浏览器(大多数)会立即尝试将其他缓存的 A 记录跳转到另一个(工作)数据中心。因此,DNS 循环不能保证会话亲和性或最低的 RTT,但当客户端是“智能”HTML 浏览器时,它似乎是确保即时故障转移的唯一方法。

编辑2:

  • 有些人建议将 TCP Anycast 作为最终解决方案。在纸(第6章)中说明了选播器故障切换是关系到BGP收敛。出于这个原因,任播可以使用 15 分钟到 20 秒来完成。在为此优化拓扑的网络上,20 秒是可能的。可能只有 …

domain-name-system high-availability anycast cdn geodns

81
推荐指数
4
解决办法
3万
查看次数

提高弹性的最佳方法?

我为 2010 年安排的主要项目之一是试图减轻我目前管理的网络中的一些单点故障 (SPOF)。我们目前有一个包含几十台服务器的数据中心机架。
在机架内部,我们是冗余且有弹性的,每台服务器有 2 个磁盘,并且可以承受一个故障。
我们的数据存储服务器有3个以上的磁盘,可以承受一个故障。我们也可以快速修复/更换损坏的硬件。每台服务器至少有一个复制伙伴,我们可以承受每个集群(即 Web、数据库、存储)中的 1 或 2 个丢失。

互联网连接由 2 100MBit 馈送通过以太网提供给我们的主要传输提供商,连接到高可用性故障转移对中的一对 Cisco ASA5500 防火墙。这不是问题。

在我看来,两个大的 SPOF 如下:

1) 我们的互联网来自一个单一的传输提供商。如果他们的网络出现故障,我们就会断开互联网。由于我们位于运营商中立的数据中心,因此很容易获得第二个 IP 传输。

2) 如果我们数据中心的电源出现问题,那么我们也会消失。

理想情况下,我希望 2 个数据中心中的服务器都使用多个 IP 传输提供商的不同路由,并通过 BGP 发布。

在第二个数据中心,我将配置 2 个 cisco 28xx 系列路由器、2 个 ASA 5500 防火墙、一对 Catalyst 48 端口交换机和十几个戴尔服务器。大致匹配主要位置。

管理层声称这种方法涉及大量费用,而且 BGP 路由过于昂贵。虽然他们似乎很高兴拥有第二个位置,但 BGP 似乎不在考虑之列。

多宿主的最后报价接近 8 万英镑。(也许他们正在询问镀金思科的报价!)

相反,管理层认为这最好使用基于 DNS 的解决方案来解决,其中我们的路由由状态正常运行时间监控服务(如 pingdom)控制,该服务更改我们的 DNS 记录(具有 1 秒 TTL)以指向替代位置在服务器故障的情况下。

大量公司出于某种原因使用 BGP,这种 DNS 解决方案不会削减它,特别是考虑到如此多的 ISP 等实际上无视短 TTL 并用更长的 TTL 替换它们。

问题:

1) 任何人都可以在西欧(阿姆斯特丹等)或美国东部(DC、VA、NY 等)推荐一个好的运营商中立数据中心吗? …

networking domain-name-system cisco scalability bgp

5
推荐指数
1
解决办法
1462
查看次数