我有一个 pandas df ,如下所示:
import pandas as pd
d = {'value1': [1, 1, 1, 2, 3, 3, 4, 4, 4, 4], 'value2': ['A', 'B', 'C', 'C', 'A', 'B', 'B', 'A', 'A', 'B']}
df = pd.DataFrame(data=d)
df
Run Code Online (Sandbox Code Playgroud)
value1我想检查列中的每个组是否在列中至少包含一个值“C” value2。如果某个组没有“C”值,我想排除该组
value1 value2
1 A
1 B
1 C
2 C
3 A
3 B
4 B
4 A
4 A
4 B
Run Code Online (Sandbox Code Playgroud)
结果 df 应如下所示:
value1 value2
1 A
1 B
1 C
2 C
Run Code Online (Sandbox Code Playgroud)
实现这一目标的最佳方法是什么?
我有一个如下所示的 Spark 数据框:
+----+------+-------------+
|user| level|value_pair |
+----+------+-------------+
| A | 25 |(23.52,25.12)|
| A | 6 |(0,0) |
| A | 2 |(11,12.12) |
| A | 32 |(17,16.12) |
| B | 22 |(19,57.12) |
| B | 42 |(10,3.2) |
| B | 43 |(32,21.0) |
| C | 33 |(12,0) |
| D | 32 |(265.21,19.2)|
| D | 62 |(57.12,50.12)|
| D | 32 |(75.12,57.12)|
| E | 63 |(0,0) |
+----+------+-------------+
Run Code Online (Sandbox Code Playgroud)
如何提取value_pair列中的值并将它们添加到名为 …