我在pyspark中有以下代码,生成的表向我显示了列的不同值及其计数。我想让另一列显示每一行代表总计数的百分比。我怎么做?
difrgns = (df1
.groupBy("column_name")
.count()
.sort(desc("count"))
.show())
Run Code Online (Sandbox Code Playgroud)
提前致谢!
我不知道如何使用 pyspark 在列中过滤正值或负值,你能帮忙吗?
我有一个包含 10MM+ 行和 50+ 列的 spark 数据框,需要计算一个特定列中的值等于或小于 0 的次数。
提前致谢。