Ran*_*guy 2 python pandas apache-spark
我有categoryDfSpark Dataframe 并且它已成功打印:
categoryDf.limit(10).toPandas()
Run Code Online (Sandbox Code Playgroud)
我想将其加入到另一个 Sparkdataframe 中。所以,我尝试了这个:
df1=spark.read.parquet("D:\\source\\202204121920-seller_central_opportunity_explorer_niche_summary.parquet")
#df1.limit(5).toPandas()
df2=df1.join(categoryDf,df1["category_id"] == categoryDf["cat_id"])
df2.show()
Run Code Online (Sandbox Code Playgroud)
当我使用df2.show()时,我看到输出为:
连接成功进行。但是当我尝试将其更改为 时df2.limit(10).toPandas(),我看到错误:
AttributeError: 'DataFrame' object has no attribute 'dtype' error in pyspark
Run Code Online (Sandbox Code Playgroud)
我想看看加入后数据如何。所以,我尝试使用df2.limit(10).toPandas(). 或者自从我的加入成功后还有其他方法可以查看数据吗?
我的Python版本是:3.7.7
火花版本是:2.4.4
我遇到了同样的问题,就我而言,这是因为连接后我有重复的列名。
我看到你在两个数据框中都有report_date和。marketplaceid对于每个重复的对,您需要删除其中一个或两个,或者重命名其中一个。
| 归档时间: |
|
| 查看次数: |
2573 次 |
| 最近记录: |