使用toPandas()方法将Spark数据帧转换为Pandas数据帧时会发生什么

fun*_*ion 3 python pandas apache-spark pyspark pyspark-sql

我有一个spark数据框,可以使用将其转换为pandas数据框。

toPandas()
Run Code Online (Sandbox Code Playgroud)

pyspark中可用的方法。

我对此有以下疑问?

  1. 这种转换是否违反了使用spark本身(分布式计算)的目的?
  2. 数据集将是巨大的,那么速度和内存问题呢?
  3. 如果有人也可以解释,那么这一行代码究竟会发生什么,那将真正有帮助。

谢谢

Woo*_*per 5

是的,一旦toPandas在spark-dataframe上调用它,它将退出分布式系统,而新的pandas数据帧将在群集的驱动程序节点中。

如果spark-data框架很大,并且不适合驱动程序内存,则会崩溃。