use*_*589 6 python scala apache-spark pyspark
我正在使用 Scala Spark 处理数据,并希望使用 pySpark/python 进行进一步处理。
下面是 Pyspark -> scala 的示例,但我正在寻找 scala->Pyspark
以下是我为 Scala-> PySpark 找到的一些方法
val pipedData = data.rdd.pipe("hdfs://namenode/hdfs/path/to/script.py")但是使用 Pipe,我失去了数据帧的好处,而在 python 中,我可能需要将其重新转换为数据帧/数据集。
关于 Scala Spark 如何使用相同的 SparkContext/session 与 PYSpark 对话,还有其他更好的方法吗?