小编Ale*_*ain的帖子

是否有一个R函数来按列名称的一部分制作子集?

我正在寻找一个函数,以便在列名末尾的几个数据帧中分割数据帧.举个例子:

Year | hour | LOT | S123_AA | S135_AA | S1763_BB | S173_BB | ...
Run Code Online (Sandbox Code Playgroud)

所以我想把它分成2个数据帧:

Year | hour | LOT | S123_AA | S135_AA |
Run Code Online (Sandbox Code Playgroud)

和

Year | hour | LOT | S1763_BB | S173_BB |
Run Code Online (Sandbox Code Playgroud)

我的关键点是保存前3列并追加结束名称为_AA和_BB的所有列.

谢谢你的时间

r dataframe

5
推荐指数
1
解决办法
95
查看次数

如何在pyspark中压缩/连接值和列表

我正在处理一个使用 4 个输入的函数。

为此,我想得到一个总结这 4 个元素的列表。但是我有两个变量,其中数据是唯一的,两个变量由列表组成。我可以用 压缩这两个列表arrays_zip,但无法获得包含 4 个元素的数组列表:

+----+----+---------+---------+
| l1 | l2 |   l3    |   l4    |
+----+----+---------+---------+
| 1  | 5  | [1,2,3] | [2,2,2] |
| 2  | 9  | [8,2,7] | [1,7,7] |
| 3  | 3  | [8,4,9] | [5,1,3] |
| 4  | 1  | [5,5,3] | [8,4,3] |

Run Code Online (Sandbox Code Playgroud)

我想得到什么:


+----+----+---------+---------+------------------------------------------+
| l1 | l2 |   l3    |   l4    |                       l5                 |
+----+----+---------+---------+------------------------------------------+
| 1  | 5  | [1,2,3] | [2,2,2] …
Run Code Online (Sandbox Code Playgroud)

apache-spark apache-spark-sql pyspark

1
推荐指数
1
解决办法
54
查看次数

标签 统计

apache-spark ×1

apache-spark-sql ×1

dataframe ×1

pyspark ×1

r ×1