小编use*_*179的帖子

从Spark RDD中删除空分区

我从HDFS获取数据并将其存储在Spark RDD中.Spark根据HDFS块的数量创建分区数.这导致大量空的分区也在管道期间被处理.为了消除这种开销,我想过滤掉RDD中的所有空分区.我知道合并和重新分区,但不能保证将删除所有空分区.

还有其他方法可以解决这个问题吗?

hadoop apache-spark rdd pyspark

9
推荐指数
1
解决办法
3529
查看次数

标签 统计

apache-spark ×1

hadoop ×1

pyspark ×1

rdd ×1