熊猫数据框到邻接矩阵

Ben*_*enP 2 python matrix dataframe data-structures pandas

我有一个如下形式的熊猫数据框:

index | id    | group
0     | abc   | A
1     | abc   | B
2     | abc   | B
3     | abc   | C
4     | def   | A
5     | def   | B
6     | ghi   | B
7     | ghi   | C
Run Code Online (Sandbox Code Playgroud)

我想将其转换为加权图/邻接矩阵,其中节点是“组”,权重是每组对共享 ID 的总和:

权重是每个 id 的组对组合的计数,因此:

AB = 'abc' indexes (0,1),(0,2) + 'def' indexes (4,5) = 3

AC = 'abc' (0,3) = 1

BC = 'abc' (2,3), (1,3) + 'ghi' (6,7) = 3
Run Code Online (Sandbox Code Playgroud)

结果矩阵将是:

    A  |B  |C
A| 0   |3  |1
B| 3   |0  |3
C| 1   |3  |0
Run Code Online (Sandbox Code Playgroud)

目前,我通过以下方式非常低效地执行此操作:

f = df.groupby(['id']).agg({'group':pd.Series.nunique}) # to count groups per id
f.loc[f['group']>1] # to get a list of the ids with >1 group

# i then for loop through the id's getting the count of values per pair (takes a long time). 
Run Code Online (Sandbox Code Playgroud)

这是第一次通过粗略的黑客方法,我确定必须有使用 groupby 或 crosstab 的替代方法,但我无法弄清楚。

Sco*_*ton 6

您可以使用以下内容:

df_merge = df.merge(df, on='id')
results = pd.crosstab(df_merge.group_x, df_merge.group_y)
np.fill_diagonal(results.values, 0)
results
Run Code Online (Sandbox Code Playgroud)

输出:

group_y  A  B  C
group_x         
A        0  3  1
B        3  0  3
C        1  3  0
Run Code Online (Sandbox Code Playgroud)

注意:您的结果与我的结果 CB 和 BC 3 而不是两个的差异是由于 B-abc 索引第 1 行和第 2 行的重复记录。