AttributeError:pyspark中的“DataFrame”对象没有属性“dtype”错误

Ran*_*guy 2 python pandas apache-spark

我有categoryDfSpark Dataframe 并且它已成功打印:

categoryDf.limit(10).toPandas()
Run Code Online (Sandbox Code Playgroud)

在此输入图像描述

我想将其加入到另一个 Sparkdataframe 中。所以,我尝试了这个:

df1=spark.read.parquet("D:\\source\\202204121920-seller_central_opportunity_explorer_niche_summary.parquet")
#df1.limit(5).toPandas()

df2=df1.join(categoryDf,df1["category_id"] == categoryDf["cat_id"])
df2.show()
Run Code Online (Sandbox Code Playgroud)

当我使用df2.show()时,我看到输出为:

在此输入图像描述

连接成功进行。但是当我尝试将其更改为 时df2.limit(10).toPandas(),我看到错误:

AttributeError: 'DataFrame' object has no attribute 'dtype' error in pyspark
Run Code Online (Sandbox Code Playgroud)

我想看看加入后数据如何。所以,我尝试使用df2.limit(10).toPandas(). 或者自从我的加入成功后还有其他方法可以查看数据吗?

我的Python版本是:3.7.7

火花版本是:2.4.4

Jos*_*e R 6

我遇到了同样的问题,就我而言,这是因为连接后我有重复的列名。

我看到你在两个数据框中都有report_date和。marketplaceid对于每个重复的对,您需要删除其中一个或两个,或者重命名其中一个。