上周我们发生了相当严重的中断,影响了几项服务,这使我们无法与客户达成 SLA。现在一切都已解决,我正在进行事后审查。
通过这次审查,我想提出一份内部文件,描述中断、其影响、我们的响应和解决方案。我想提出一个相当标准的形式以供将来重用。我已经在下面列出了我的想法,但还应该包括哪些其他项目?如果这是与安全相关的事件,您会添加什么?
尽量将帖子简化为一项和解释,并且可以使用最高投票的答案更新此帖子。
你好,
我想问一下集体对分布式监控系统的看法和看法,您使用什么以及您知道哪些可能符合我的要求?
要求相当复杂;
没有单点故障。真的。我是认真的!需要能够容忍单/多节点故障,包括“主节点”和“工作节点”,您可以假设没有监控位置(“站点”)中有多个节点,或者位于同一网络上。因此,这可能排除了传统的 HA 技术,例如 DRBD 或 Keepalive。
分布式逻辑,我想在多个网络、多个数据中心和多个大陆上部署 5 个以上的节点。我希望从我的客户的角度来看我的网络和应用程序的“鸟瞰”视图,当你有 50 多个节点,甚至 500 多个节点时,监控逻辑的加分不会陷入困境。
需要能够处理相当合理数量的主机/服务检查,就像 Nagios,一般假设有 1500-2500 个主机和 30 个服务每个主机。如果添加更多监控节点允许您相对线性地扩展,那就太好了,也许在 5 年内我可能希望监控 5000 台主机和每台主机 40 个服务!从我上面关于“分布式逻辑”的注释中添加,很高兴地说:
图形和管理友好的功能。我们需要跟踪我们的 SLA,了解我们的“高可用”应用程序是否 24x7 都在一定程度上有用。理想情况下,您提出的解决方案应该以最少的方式进行“开箱即用”的报告。
必须有一个可靠的 API 或插件系统来开发定制检查。
需要了解警报。我不想知道(通过 SMS,凌晨 3 点!)一个监控节点认为我的核心路由器已关闭。我确实想知道他们中是否有一定比例的人同意正在发生一些时髦的事情;) 基本上我在这里谈论的是“法定人数”逻辑,或者将理智应用于分布式疯狂!
我愿意同时考虑商业和开源选项,尽管我更愿意避开价值数百万英镑的软件:-) 我也愿意接受可能没有任何东西可以满足所有这些要求,但是想问问集体那个。
在考虑监控节点及其位置时,请记住其中大部分将是随机 ISP 网络上的专用服务器,因此在很大程度上超出了我的控制范围。依赖 BGP 馈送和其他复杂网络操作的解决方案可能不适合。
我还应该指出,过去我已经评估、部署或大量使用/定制了大多数开源风格,包括 Nagios、Zabbix 和朋友——它们确实不是坏工具,但总体上还是平庸的。”分布式”方面,特别是关于我的问题和“智能”警报中讨论的逻辑。
很高兴澄清所需的任何要点。欢呼吧伙计们和女孩们:-)
我们目前在具有冗余 ip 连接的位置运行 ASA9。我们很乐意进行配置,ip sla以便 Internet 访问能够在单个运营商中断的情况下继续存在。我知道 ip sla 命令,但是当我尝试预填充所需的 NAT 规则时,第二条规则的添加将覆盖第一条规则。下面是一个例子:
object network NYHQ_GUESTWIRELESS_10.110.6.0_24
nat (NYHQ-GUESTWIRELESS,NYHQ-OUTSIDE_FIOS) dynamic interface
Run Code Online (Sandbox Code Playgroud)
当我尝试添加额外的 nat 规则时,也许
nat (NYHQ-GUESTWIRELESS,NYHQ-OUTSIDE_COGENT) dynamic interface
新规则会覆盖先前存在的规则,如下所示:
object network NYHQ_GUESTWIRELESS_10.110.6.0_24
nat (NYHQ-GUESTWIRELESS,NYHQ-OUTSIDE_COGENT) dynamic interface
Run Code Online (Sandbox Code Playgroud)
有什么方法可以让这两个规则都到位,以便 NAT 可以与我们的 SLA 规则合作,以确保无论使用哪个提供商,NAT 仍能正常工作?
环境是这样的:
在围墙花园中托管论坛/期刊/bboard/电子邮件/社交媒体应用程序的网站(即您付费使用它或被邀请使用它
许多客户在特定的时间段内付费使用该站点(即他们租用站点的访问权限)以便与他们的客户进行交互。在广泛的领域有几十个客户。
有一个非常广泛的服务水平协议。这意味着它没有说明网站不能关闭超过十分钟,但有一位绅士同意它不会。他们不会为我们提供的 24/7 支持付费,因为我们热爱我们的工作。
网站在多个时区以 7 种不同的语言运行。
这是情况:
由于 DDOS 攻击,该站点在 5:30EST 关闭并保持“离线”状态大约两个小时。客户的反应从恼怒到愤怒不等。客户也不是很精通技术。客户习惯于 24/7 全天候支持,并且通常会得到很好的支持。
这是问题:
您向客户透露了多少有关 DDOS 攻击的信息?他们想要一个关于网站关闭的原因。
sla ×6
cisco ×1
cisco-asa ×1
ddos ×1
monitoring ×1
nagios ×1
nat ×1
outage ×1
redundancy ×1
service ×1