小编sam*_*son的帖子

检查每个组是否存在一个值,并删除 pandas df 中没有该值的组

我有一个 pandas df ,如下所示:

import pandas as pd
d = {'value1': [1, 1, 1, 2, 3, 3, 4, 4, 4, 4], 'value2': ['A', 'B', 'C', 'C', 'A', 'B', 'B', 'A', 'A', 'B']}
df = pd.DataFrame(data=d)
df
Run Code Online (Sandbox Code Playgroud)

value1我想检查列中的每个组是否在列中至少包含一个值“C” value2。如果某个组没有“C”值,我想排除该组

    value1  value2
    1       A
    1       B
    1       C
    2       C
    3       A
    3       B
    4       B
    4       A
    4       A
    4       B
Run Code Online (Sandbox Code Playgroud)

结果 df 应如下所示:

    value1  value2
    1       A
    1       B
    1       C
    2       C
Run Code Online (Sandbox Code Playgroud)

实现这一目标的最佳方法是什么?

python dataframe pandas

2
推荐指数
1
解决办法
833
查看次数

从 Spark 数据框中的列中提取值并提取到两个新列

我有一个如下所示的 Spark 数据框:

    +----+------+-------------+
    |user| level|value_pair   |
    +----+------+-------------+
    | A  | 25   |(23.52,25.12)|
    | A  | 6    |(0,0)        |
    | A  | 2    |(11,12.12)   |
    | A  | 32   |(17,16.12)   |
    | B  | 22   |(19,57.12)   |
    | B  | 42   |(10,3.2)     |
    | B  | 43   |(32,21.0)    |
    | C  | 33   |(12,0)       |
    | D  | 32   |(265.21,19.2)|
    | D  | 62   |(57.12,50.12)|
    | D  | 32   |(75.12,57.12)|
    | E  | 63   |(0,0)        |
    +----+------+-------------+
Run Code Online (Sandbox Code Playgroud)

如何提取value_pair列中的值并将它们添加到名为 …

apache-spark apache-spark-sql pyspark

1
推荐指数
1
解决办法
1375
查看次数