小编loc*_*ter的帖子

将 pcollection 的每一行拆分为多个 pcollection?

在进行一些处理并按键分组后,我得到了如下所示的数据集。我现在需要对每一行数据进行一些处理以获得下面的输出。我尝试过平面地图,它真的很慢,因为“值”列表的长度可以是任意长的。我想我可以将每一行分成单独的 pcollections,并行处理,然后将它们压平在一起。如何将每一行拆分为不同的 pcollection?如果这不可行,是否有其他方法可以加快计算速度?

输入

key, value
1    [A, B, B, B]
2    [A, B, B, B]
3    [A, B, B, B]
4    [A, B, B, B]
5    [A, B, B, B]
Run Code Online (Sandbox Code Playgroud)

输出:

key, value
1    (A, 0)
1    (B, 1)
1    (B, 2)
1    (B, 3)
2    (A, 0)
2    (B, 1)
2    (B, 2)
2    (B, 3)
...
Run Code Online (Sandbox Code Playgroud)

python apache-beam

5
推荐指数
1
解决办法
1426
查看次数

标签 统计

apache-beam ×1

python ×1