标签: sla

记录停机以进行事后审查

上周我们发生了相当严重的中断,影响了几项服务,这使我们无法与客户达成 SLA。现在一切都已解决,我正在进行事后审查。

通过这次审查,我想提出一份内部文件,描述中断、其影响、我们的响应和解决方案。我想提出一个相当标准的形式以供将来重用。我已经在下面列出了我的想法,但还应该包括哪些其他项目?如果这是与安全相关的事件,您会添加什么?

  • 摘要事件的执行级别摘要。
  • 受影响的服务
  • 影响对我们的用户和 SLA 有何影响?是否存在以美元计算的成本、错过的交易、失去的客户等?
  • 中断持续时间对于每个受影响的服务,如果有差异
  • 原因包括主要和次要原因
  • 解析度
  • 事件时间表通知、与外部供应商的联系、客户通知、响应等。
  • 我们的响应存在问题 我们对中断的响应是否没有按计划进行?正确的人通知?供应商是否履行了合同义务?
  • 要采取的预防措施我们如何防止这种中断再次发生或减少其影响?
  • 检测方法我们检测到这次中断的效果如何?我们将来如何改进检测?
  • 在未来的停电响应中进行的更改

尽量将帖子简化为一项和解释,并且可以使用最高投票的答案更新此帖子。

sla outage

14
推荐指数
2
解决办法
4781
查看次数

地理分布式、容错和“智能”应用/主机监控系统

你好,

我想问一下集体对分布式监控系统的看法和看法,您使用什么以及您知道哪些可能符合我的要求?

要求相当复杂;

  • 没有单点故障。真的。我是认真的!需要能够容忍单/多节点故障,包括“主节点”和“工作节点”,您可以假设没有监控位置(“站点”)中有多个节点,或者位于同一网络上。因此,这可能排除了传统的 HA 技术,例如 DRBD 或 Keepalive。

  • 分布式逻辑,我想在多个网络、多个数据中心和多个大陆上部署 5 个以上的节点。我希望从我的客户的角度来看我的网络和应用程序的“鸟瞰”视图,当你有 50 多个节点,甚至 500 多个节点时,监控逻辑的加分不会陷入困境。

  • 需要能够处理相当合理数量的主机/服务检查,就像 Nagios,一般假设有 1500-2500 个主机和 30 个服务每个主机。如果添加更多监控节点允许您相对线性地扩展,那就太好了,也许在 5 年内我可能希望监控 5000 台主机和每台主机 40 个服务!从我上面关于“分布式逻辑”的注释中添加,很高兴地说:

    • 在正常情况下,这些检查必须在 $n 或 n% 的监控节点上运行。
    • 如果检测到故障,则对另一个 $n 或 n% 的节点运行检查,关联结果,然后使用它们来确定是否满足标准以发出警报。
  • 图形和管理友好的功能。我们需要跟踪我们的 SLA,了解我们的“高可用”应用程序是否 24x7 都在一定程度上有用。理想情况下,您提出的解决方案应该以最少的方式进行“开箱即用”的报告。

  • 必须有一个可靠的 API 或插件系统来开发定制检查。

  • 需要了解警报。我不想知道(通过 SMS,凌晨 3 点!)一个监控节点认为我的核心路由器已关闭。我确实想知道他们中是否有一定比例的人同意正在发生一些时髦的事情;) 基本上我在这里谈论的是“法定人数”逻辑,或者将理智应用于分布式疯狂!

我愿意同时考虑商业和开源选项,尽管我更愿意避开价值数百万英镑的软件:-) 我也愿意接受可能没有任何东西可以满足所有这些要求,但是想问问集体那个。

在考虑监控节点及其位置时,请记住其中大部分将是随机 ISP 网络上的专用服务器,因此在很大程度上超出了我的控制范围。依赖 BGP 馈送和其他复杂网络操作的解决方案可能不适合。

我还应该指出,过去我已经评估、部署或大量使用/定制了大多数开源风格,包括 Nagios、Zabbix 和朋友——它们确实不是坏工具,但总体上还是平庸的。”分布式”方面,特别是关于我的问题和“智能”警报中讨论的逻辑。

很高兴澄清所需的任何要点。欢呼吧伙计们和女孩们:-)

monitoring nagios sla

12
推荐指数
1
解决办法
1472
查看次数

在哪里可以找到好的 SLA 协议?

我想找到一个提供示例服务级别协议 (SLA) 的网站。有谁知道我在哪里可以找到好的例子?

service sla

10
推荐指数
1
解决办法
539
查看次数

SLA 和 OLA 之间有什么区别?

  • SLA = 服务水平协议
  • OLA = 运营/运营级别协议

两者有什么区别?还是真的有区别?

sla

6
推荐指数
2
解决办法
1万
查看次数

在利用 ASA-8.3 后的 NAT 语法时,如何在使用 ASA IP-SLA 时配置 NAT 规则?

我们目前在具有冗余 ip 连接的位置运行 ASA9。我们很乐意进行配置,ip sla以便 Internet 访问能够在单个运营商中断的情况下继续存在。我知道 ip sla 命令,但是当我尝试预填充所需的 NAT 规则时,第二条规则的添加将覆盖第一条规则。下面是一个例子:


object network NYHQ_GUESTWIRELESS_10.110.6.0_24
 nat (NYHQ-GUESTWIRELESS,NYHQ-OUTSIDE_FIOS) dynamic interface
Run Code Online (Sandbox Code Playgroud)

当我尝试添加额外的 nat 规则时,也许

nat (NYHQ-GUESTWIRELESS,NYHQ-OUTSIDE_COGENT) dynamic interface

新规则会覆盖先前存在的规则,如下所示:


object network NYHQ_GUESTWIRELESS_10.110.6.0_24
 nat (NYHQ-GUESTWIRELESS,NYHQ-OUTSIDE_COGENT) dynamic interface
Run Code Online (Sandbox Code Playgroud)

有什么方法可以让这两个规则都到位,以便 NAT 可以与我们的 SLA 规则合作,以确保无论使用哪个提供商,NAT 仍能正常工作?

cisco nat redundancy sla cisco-asa

6
推荐指数
1
解决办法
1045
查看次数

DDOS 攻击受害者 - 承认多少?

环境是这样的:

  1. 在围墙花园中托管论坛/期刊/bboard/电子邮件/社交媒体应用程序的网站(即您付费使用它或被邀请使用它

  2. 许多客户在特定的时间段内付费使用该站点(即他们租用站点的访问权限)以便与他们的客户进行交互。在广泛的领域有几十个客户。

  3. 有一个非常广泛的服务水平协议。这意味着它没有说明网站不能关闭超过十分钟,但有一位绅士同意它不会。他们不会为我们提供的 24/7 支持付费,因为我们热爱我们的工作。

  4. 网站在多个时区以 7 种不同的语言运行。

这是情况:

由于 DDOS 攻击,该站点在 5:30EST 关闭并保持“离线”状态大约两个小时。客户的反应从恼怒到愤怒不等。客户也不是很精通技术。客户习惯于 24/7 全天候支持,并且通常会得到很好的支持。

这是问题:

您向客户透露了多少有关 DDOS 攻击的信息?他们想要一个关于网站关闭的原因。

sla ddos best-practices

3
推荐指数
1
解决办法
716
查看次数

标签 统计

sla ×6

best-practices ×1

cisco ×1

cisco-asa ×1

ddos ×1

monitoring ×1

nagios ×1

nat ×1

outage ×1

redundancy ×1

service ×1