相关疑难解决方法(0)

Apache Spark-Spark中的内部作业调度程序如何定义什么是用户和什么是池

对于在这里有点笼统,我感到很抱歉,但是对于作业调度在内部如何在Spark中工作,我感到有些困惑。从这里的文档中我了解到这是Hadoop Fair Scheduler的某种实现。

我无法四处了解用户到底是谁(Linux用户,hadoop用户,spark客户?)。我也无法理解此处如何定义池。例如,在我的hadoop集群中,我已将资源分配给了两个不同的池(让我们将它们称为团队1和团队2)。但是在Spark集群中,不同的池是否会实例化,并且其中的用户会实例化自己的Spark上下文?再次让我怀疑,当我将属性设置为spark.scheduler.pool时,我应该传递哪些参数。

我对驱动程序如何实例化spark上下文,然后将它们拆分为任务和作业有基本的了解。可能是我在这里完全没有指出要点,但我真的很想了解Spark的内部调度程序如何在操作,任务和工作的上下文中工作

hadoop scala bigdata job-scheduling apache-spark

5
推荐指数
2
解决办法
2905
查看次数

标签 统计

apache-spark ×1

bigdata ×1

hadoop ×1

job-scheduling ×1

scala ×1