小智 3

不确定,您可以直接执行此操作,但您可以首先将 Spark Dataframe(在 pyspark 上)转换为 pandas 并将其存储到 Feather:

pandas_df = spark_df.toPandas()

feather.write_feather(pandas_df, 'example_feather')

但恐怕这会对性能产生影响。

  • 是的,只有当你的数据帧适合内存时它才有效。所以,这不正是我想要的。 (6认同)