我的问题类似于这个线程: 在Spark SQL中按多列分区
但是我在Pyspark而不是Scala工作,我想把列表中的列列表传递给我.我想做这样的事情:
column_list = ["col1","col2"]
win_spec = Window.partitionBy(column_list)
Run Code Online (Sandbox Code Playgroud)
我可以得到以下工作:
win_spec = Window.partitionBy(col("col1"))
Run Code Online (Sandbox Code Playgroud)
这也有效:
col_name = "col1"
win_spec = Window.partitionBy(col(col_name))
Run Code Online (Sandbox Code Playgroud)
这也有效:
win_spec = Window.partitionBy([col("col1"), col("col2")])
Run Code Online (Sandbox Code Playgroud) 有没有办法在 MLflow 中管理实验级别的权限?我们希望有一个共享服务器,但希望能够在实验级别管理权限 - 例如管理员可以查看所有实验,user_group1 可以管理实验1 - 也许不同的组可以查看结果与发布结果。
看起来在 databricks 中是可能的:https://docs.databricks.com/administration-guide/access-control/workspace-acl.html#experiment-permissions 但我在开源 API 文档中找不到任何内容。
谢谢。
在 spark 中,我希望能够并行处理多个数据帧。
我正在尝试的方法是将数据帧嵌套在父数据帧中,但我不确定语法或是否可能。
例如,我有以下 2 个数据帧:df1:
+-----------+---------+--------------------+------+
|id |asset_id | date| text|
+-----------+---------+--------------------+------+
|20160629025| A1|2016-06-30 11:41:...|aaa...|
|20160423007| A1|2016-04-23 19:40:...|bbb...|
|20160312012| A2|2016-03-12 19:41:...|ccc...|
|20160617006| A2|2016-06-17 10:36:...|ddd...|
|20160624001| A2|2016-06-24 04:39:...|eee...|
Run Code Online (Sandbox Code Playgroud)
df2:
+--------+--------------------+--------------+
|asset_id| best_date_time| Other_fields|
+--------+--------------------+--------------+
| A1|2016-09-28 11:33:...| abc|
| A1|2016-06-24 00:00:...| edf|
| A1|2016-08-12 00:00:...| hij|
| A2|2016-07-01 00:00:...| klm|
| A2|2016-07-10 00:00:...| nop|
Run Code Online (Sandbox Code Playgroud)
所以我想结合这些来制作这样的东西。
+--------+--------------------+-------------------+
|asset_id| df1| df2|
+--------+--------------------+-------------------+
| A1| [df1 - rows for A1]|[df2 - rows for A1]|
| A2| [df1 - rows for A2]|[df2 - …Run Code Online (Sandbox Code Playgroud)