相关疑难解决方法(0)

Spark Job错误:YarnAllocator:退出状态:-100.诊断:在*lost*节点上发布容器

我正在使用以下conf在AWS-EMR 4.1,Spark 1.5上运行一份工作:

spark-submit --deploy-mode cluster --master yarn-cluster --driver-memory 200g --driver-cores 30 --executor-memory 70g --executor-cores 8 --num-executors 90 --conf spark.storage.memoryFraction=0.45 --conf spark.shuffle.memoryFraction=0.75 --conf spark.task.maxFailures=1 --conf spark.network.timeout=1800s
Run Code Online (Sandbox Code Playgroud)

然后我得到了下面的错误.我在哪里可以找到什么是"退出状态:-100"?我怎么能解决这个问题呢?谢谢!


15/12/05 05:54:24 INFO TaskSetManager: Finished task 176.0 in stage 957.0 (TID 128408) in 130885 ms on ip-10-155-195-239.ec2.internal (106/800)
15/12/05 05:54:24 INFO YarnAllocator: Completed container container_1449241952863_0004_01_000026 (state: COMPLETE, exit status: -100)
15/12/05 05:54:24 INFO YarnAllocator: Container marked as failed: container_1449241952863_0004_01_000026. Exit status: -100. Diagnostics: Container released on a *lost* node
15/12/05 05:54:24 …
Run Code Online (Sandbox Code Playgroud)

amazon-web-services emr hadoop-yarn apache-spark

9
推荐指数
0
解决办法
2956
查看次数

集群中节点不健康

集群上的节点处于不健康状态的原因有哪些?

根据我有限的理解,当给定节点上的 HDFS 利用率超过阈值时,通常会发生这种情况。此阈值是使用 max-disk-utilization-per-disk-percentage 属性定义的。

我有时观察到在 Spark-sql 上触发内存密集型 Spark 作业或使用 pyspark 节点进入不健康状态。经过进一步查看,我在处于不健康状态的节点上进行了 ssh,发现实际上 dfs 利用率低于 75%,并且在我的集群上为上述属性设置的值是 99。

所以我认为我遗漏了一些其他事实,这基本上导致了这种行为。

在此先感谢您的帮助。

曼尼什·梅赫拉

hdfs amazon-emr emr hadoop-yarn apache-spark-sql

1
推荐指数
1
解决办法
6744
查看次数