小编prk*_*prk的帖子

使用列表中的列对PySpark中的多个列进行分区

我的问题类似于这个线程: 在Spark SQL中按多列分区

但是我在Pyspark而不是Scala工作,我想把列表中的列列表传递给我.我想做这样的事情:

column_list = ["col1","col2"]
win_spec = Window.partitionBy(column_list)
Run Code Online (Sandbox Code Playgroud)

我可以得到以下工作:

win_spec = Window.partitionBy(col("col1"))
Run Code Online (Sandbox Code Playgroud)

这也有效:

col_name = "col1"
win_spec = Window.partitionBy(col(col_name))
Run Code Online (Sandbox Code Playgroud)

这也有效:

win_spec = Window.partitionBy([col("col1"), col("col2")])
Run Code Online (Sandbox Code Playgroud)

window-functions apache-spark pyspark

5
推荐指数
3
解决办法
8505
查看次数

有没有办法在 MLflow 中管理实验级别的权限?

有没有办法在 MLflow 中管理实验级别的权限?我们希望有一个共享服务器,但希望能够在实验级别管理权限 - 例如管理员可以查看所有实验,user_group1 可以管理实验1 - 也许不同的组可以查看结果与发布结果。

看起来在 databricks 中是可能的:https://docs.databricks.com/administration-guide/access-control/workspace-acl.html#experiment-permissions 但我在开源 API 文档中找不到任何内容。

谢谢。

mlflow

5
推荐指数
1
解决办法
2862
查看次数

你可以在另一个数据帧中嵌套一个 Spark 数据帧吗?

在 spark 中,我希望能够并行处理多个数据帧。

我正在尝试的方法是将数据帧嵌套在父数据帧中,但我不确定语法或是否可能。

例如,我有以下 2 个数据帧:df1:

+-----------+---------+--------------------+------+
|id         |asset_id |                date|  text|
+-----------+---------+--------------------+------+
|20160629025|       A1|2016-06-30 11:41:...|aaa...|
|20160423007|       A1|2016-04-23 19:40:...|bbb...|
|20160312012|       A2|2016-03-12 19:41:...|ccc...|
|20160617006|       A2|2016-06-17 10:36:...|ddd...|
|20160624001|       A2|2016-06-24 04:39:...|eee...|
Run Code Online (Sandbox Code Playgroud)

df2:

+--------+--------------------+--------------+
|asset_id|      best_date_time|  Other_fields|
+--------+--------------------+--------------+
|      A1|2016-09-28 11:33:...|           abc|
|      A1|2016-06-24 00:00:...|           edf|
|      A1|2016-08-12 00:00:...|           hij|
|      A2|2016-07-01 00:00:...|           klm|
|      A2|2016-07-10 00:00:...|           nop|
Run Code Online (Sandbox Code Playgroud)

所以我想结合这些来制作这样的东西。

+--------+--------------------+-------------------+
|asset_id|                 df1|                df2|
+--------+--------------------+-------------------+
|      A1| [df1 - rows for A1]|[df2 - rows for A1]|
|      A2| [df1 - rows for A2]|[df2 - …
Run Code Online (Sandbox Code Playgroud)

dataframe apache-spark apache-spark-sql pyspark pyspark-sql

3
推荐指数
1
解决办法
504
查看次数