从 Scala/Java Spark 运行 PySpark

use*_*589 6 python scala apache-spark pyspark

我正在使用 Scala Spark 处理数据,并希望使用 pySpark/python 进行进一步处理。

下面是 Pyspark -> scala 的示例,但我正在寻找 scala->Pyspark

https://www.crowdstrike.com/blog/spark-hot-potato-passing-dataframes- Between-scala-spark-and-pyspark/

以下是我为 Scala-> PySpark 找到的一些方法

  1. Jython 是一种方式 -> 但它没有像 Python 那样拥有所有 api/libs
  2. 管道方法-> val pipedData = data.rdd.pipe("hdfs://namenode/hdfs/path/to/script.py")

但是使用 Pipe,我失去了数据帧的好处,而在 python 中,我可能需要将其重新转换为数据帧/数据集。

关于 Scala Spark 如何使用相同的 SparkContext/session 与 PYSpark 对话,还有其他更好的方法吗?