我们在google云平台上搭建了一个GKE集群。
我们有一项需要“爆发”计算能力的活动。
想象一下,我们通常平均每小时进行 100 次计算,然后突然我们需要能够在不到两分钟的时间内处理 100000 次计算。然而大多数时候,一切都接近闲置。
我们不想为 99% 的时间都闲置的服务器付费,并希望根据实际使用情况扩展集群(不需要数据持久化,之后可以删除服务器)。我查找了 kubernetes 上有关自动缩放的可用文档,以使用HPA添加更多 pod 并使用添加更多 pod 以及使用集群自动缩放器
然而,这些解决方案似乎都不会真正降低我们的成本或提高性能,因为它们的扩展似乎无法超出 GCP 计划:
想象一下,我们有一个带有 8 个 CPU 的google 计划。我的理解是,如果我们使用集群自动缩放器添加更多节点,我们将不再是每个使用 4 个 CPU 的 2 个节点,而是每个使用 2 个 CPU 的 4 个节点。但总可用计算能力仍为 8 个 CPU。对于具有更多 pod 而不是更多节点的 HPA,也有同样的推理。
如果我们有 8 个 CPU 付款计划,但只使用其中 4 个,我的理解是我们仍然需要按 8 个 CPU 付费,因此缩小规模并不是很有用。
我们想要的是自动缩放以暂时更改我们的付款计划(想象一下从 n1-standard-8 到 n1-standard-16)并获得实际的新计算能力。
我不敢相信我们是唯一拥有此用例的人,但我在任何地方都找不到任何相关文档!我是不是误会了什么?