相关疑难解决方法(0)

Spark:从RDD检索大数据到本地计算机的最佳实践

我在纱线集群中有大RDD(1gb).在使用此群集的本地计算机上,我只有512 MB.我想在本地机器上迭代RDD中的值.我不能使用collect(),因为它会在本地创建太大的数组,这比我的堆更多.我需要一些迭代的方式.有方法iterator(),但它需要一些额外的信息,我无法提供.

UDP:提交给LocalIterator方法

apache-spark

39
推荐指数
3
解决办法
4万
查看次数

是否有更好的方法来显示整个Spark SQL DataFrame?

我想用Scala API显示整个Apache Spark SQL DataFrame.我可以使用这个show()方法:

myDataFrame.show(Int.MaxValue)
Run Code Online (Sandbox Code Playgroud)

有没有比使用更好的方式来显示整个DataFrame Int.MaxValue?

scala apache-spark apache-spark-sql

36
推荐指数
2
解决办法
7万
查看次数

标签 统计

apache-spark ×2

apache-spark-sql ×1

scala ×1